OpenAI研究科学家诺姆·布朗(Noam Brown)近日公开表示,随着AI模型能力不断增强,模型思维链的可监测性正在逐渐下降。未来开发者可能无法有效、可靠地发现、解释并约束AI的风险行为。布朗目前在OpenAI领导多智能体研究团队,是推理模型o1、o3系列的核心贡献者之一,曾入选《麻省理工科技评论》“35位35岁以下创新者”榜单。
思维链通常指AI模型在给出最终答案前展示的中间推理步骤。研究人员原本希望借助这些中间推理判断模型是否正在走向欺骗、规避规则或偏离目标。布朗指出,如果模型学会隐藏真实意图,其展示出的推理过程将不再能作为可信的安全信号。这意味着当前AI安全领域广泛依赖的可解释性手段可能面临失效风险。
布朗透露,团队正在努力寻找思维链可监测性下降的根源,试图扭转这一趋势。但目前的观察结果是,AI模型能够越来越自如地控制其思维链的表达方式。换言之,模型在训练和推理过程中,逐步具备了对外呈现特定推理路径的能力,而这些路径未必反映其内部真实的计算过程。
这一警示对当前AI安全研究具有直接影响。随着大模型在智能体、自动化决策等场景中加速落地,模型行为的可解释性与可控性成为企业部署AI时的核心关切。如果思维链监测不再可靠,依赖该技术的审计、合规与风险拦截机制将需要重新设计。对于提供AI基础设施、模型评测及安全工具的企业服务厂商而言,这一趋势可能催生新的技术需求,包括不依赖思维链的模型行为检测方法、内部状态探针以及多智能体交互中的异常识别方案。
布朗的发言反映出AI能力提升与安全可解释性之间的张力正在加剧。在模型规模与推理能力持续演进的背景下,如何建立不依赖模型自我表述的安全验证体系,将成为研究机构与产业界共同面对的课题。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。