微软CEO纳德拉提出AI系统七大设计原则,强调开发者应默认假设模型失控

我们必须假设模型已被破坏,并从一开始就将其控制。

微软CEO萨蒂亚·纳德拉于北京时间10月10日晚发表长文,就AI时代的安全与信任架构提出系统性观点。他指出,随着AI模型和智能体系统被赋予访问敏感数据、代表用户执行关键任务的能力,仅依靠超级智能自我监控等简单策略已不足以应对风险。纳德拉强调,模型提供商无法将责任外包,开发者应当默认假设模型可能失控,并围绕可观测性原则重新设计系统架构。

纳德拉将AI模型与传统软件进行了对比。传统软件系统经过数十年部署,人类已拥有追踪特定代码路径行为的工具和能力。而AI模型虽然能力更强,本质上却是一个黑盒子。当前企业部署的复杂智能体系统和模型正在访问最敏感的数据,并被赋予代表用户执行关键任务的能力,这使得重新评估新时代的信任架构成为必要。他认为,不能将超级智能视为一套嵌套的黑匣子,仅简单地接受或拒绝其建议、答案和行动,而必须建立能够观察其行为、可测试极限并始终可容纳行为的封闭系统。

为此,纳德拉提出七项具体设计原则。模型多样性方面,没有任何模型应成为重要结果的唯一依赖,也不应负责验证自身工作。观察一切原则要求每一个有意义的模型动作都必须留下防篡改、人类可读的证据,且能够在不依赖模型自证的情况下重现结果。可验证性要求持续测试整个系统,包括故障、攻击、边缘案例和系统变更,而非仅关注成功任务。独立控制指组织应能独立决定模型可以访问什么以及可以采取哪些行动。独立审计性要求验证必须独立于被验证的智能,没有任何单一模型应同时控制系统的行为以及判断该行为是否与原始意图一致所需的证据。

在遏制方面,纳德拉明确表示必须假设模型已被破坏,并从一开始就将其控制,授权人员应始终能够在任务中暂停或关闭模型。他同时指出,更先进的模型将需要更先进的遏制技术,行业需要对此进行标准化。事件披露原则要求当系统出现故障或被攻破时,及时向受影响者披露信息,并建立机制分享出错原因、哪些控制失效以及如何防止再次发生,向整个行业分享经验,这应包括在运行时改变智能体行为的实现细节。

纳德拉将前沿封闭权重和开放权重模型均视为内部风险,理由并非AI模型一定恶意,而是任何有足够能力接触重要系统的行为者都可能犯错或被攻破,遏制和控制的架构必须考虑到这一现实。这一表态反映出,随着AI智能体在企业关键业务中的渗透加深,模型治理与安全架构正从技术问题上升为组织必须面对的系统性挑战。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
山灵 SM50 桌面串流一体机本月上市,搭 ES9039Q2M DAC 芯片
上一篇 15小时前
SaaS 的下一站是 Agentforce ?Salesforce 押注 AI 工作流革命
下一篇 2025年5月26日 上午9:03

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部