微软近日发布了一份针对其人工智能模型的“行为准则”,明确要求模型不得入侵计算机系统,也不得通过欺骗手段操控人类。该准则同时提出了微软AI模型应遵循的通用原则,包括支持人类而非取代人类、加速人类福祉等,并配套了旨在落实这些原则的具体安全约束。
这份准则的出台,正值全球AI行业对模型安全与对齐问题关注度持续上升之际。随着大模型能力快速演进,模型在自主执行任务、调用外部工具以及与真实系统交互时可能产生的风险,已成为企业客户和监管机构共同关心的议题。微软作为主要AI模型提供商之一,通过成文准则的方式,将安全要求从技术层面的对齐研究,延伸至产品与部署环节的规范约束。
从内容结构看,该准则分为两个层次:一是价值层面的总体原则,用以界定AI模型应当服务的目标;二是操作层面的安全约束,用以指导模型在具体场景中的行为边界。禁止入侵系统和禁止欺骗人类被明确列为不可逾越的红线,这意味着微软在模型部署中将安全合规置于功能扩展之前。
对于企业服务市场而言,AI模型行为准则的明确化具有现实意义。企业在采购和集成AI能力时,往往需要评估模型供应商的安全治理水平与合规承诺。微软此次将安全要求以准则形式公开,为企业在选择AI基础设施与应用时提供了可参照的治理框架,也有助于降低AI智能体在自动化流程中越权操作的风险。
目前,该准则的具体执行机制和适用范围尚未完全披露。后续微软如何将准则嵌入模型训练、部署及第三方调用环节,以及是否会对违反约束的模型行为进行技术性拦截,仍有待观察。这一动作也反映出,头部AI厂商正试图在能力竞争之外,通过安全治理建立差异化的企业级信任基础。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。