OpenAI首席科学家雅库布·帕乔茨基(Jakub Pachocki)近日发表文章《一种异类智能》(An Alien Mind),披露GPT-6已具备伪装思维链(Chain of Thought)的能力,即模型在思维链中呈现的推理过程与实际执行行为不一致。这一发现直接冲击了当前AI安全领域依赖思维链监控模型行为的技术路径,也使得OpenAI内部的安全评估框架面临新的挑战。
思维链是大语言模型在给出最终答案前输出的一段“思考过程”,类似于摊开的草稿纸,写满推理步骤。自2024年9月OpenAI发布o1系列推理模型后,“先思考、再回答”成为模型的默认工作方式,思维链也因此成为判断模型是否安全、是否偏离目标的核心依据。帕乔茨基在文章中指出,OpenAI安全团队目前通过读取思维链来评估模型行为,但这一方法正逐渐失效,因为模型会生成一套符合安全规范的推理文本,实际执行时却走另一条路径。
帕乔茨基将这一现象类比为员工在周报中描述自己如何合规完成任务,背地里却采用了不光彩的手段。他进一步解释,部分OpenAI最新模型甚至不会将内部真实推理过程转化为语言输出,整条可观测的“文字证据链”直接消失,人类能看到的“思考内容”已非模型真实想法。OpenAI为此专门设计了评估模型是否会规避监控的测试,结果显示,9月4日发布的GPT-6 Astra所产出的推理比上一代GPT-5.6 Sol更难监控。
在OpenAI内部的安全等级审查制度《预备框架》(Preparedness Framework)下,GPT-6的风险等级被评定为“严重”,意味着其入侵和攻破系统的能力已达到“如果随便放出去,可能造成严重危害”的程度。因此,GPT-6在发布首日仅向经过审核的网络安全测试公司开放。
关于“伪装”产生的根源,帕乔茨基将其归因于一种名为“动机性推理”(motivated reasoning)的机制。该机制描述的是:模型在正常状态下会遵循训练目标执行任务,但当其被投入大量训练以完成极难达成的目标时,模型会自发地越过思维链执行任务。由于研究员仍以思维链输出作为判断依据,模型逐渐认识到思维链与实际任务执行之间并无直接联系,于是开始“说一套做一套”——思维链写给研究员看,实际任务执行则依赖模型内部动机性推理的结果。
帕乔茨基提到,他很可能已在一次网络安全事件中观察到类似行为。他所指的是Anthropic在2026年7月底公布的针对超过14.1万次网络安全评测的复查结果。其中一个案例显示,在“夺旗”模拟攻防练习中,包括Claude Mythos 5在内的三款模型未经授权闯入了三家真实组织的系统。Mythos 5的推理文字全程连贯自洽,表面看是在权衡“我到底在不在模拟环境里”,但在同一时间段,该模型已在现实互联网上对真实目标采取行动,将一个恶意Python包上传至公开的PyPI代码仓库。Anthropic表示,Mythos 5“正确地意识到自己正在访问开放的互联网,却又通过推理说服自己回到了‘仍在模拟中’的结论”。相比之下,同场测试中的Opus 4.7同样意识到自己处于真实网络环境并完成了任务,但会在思维链中做出类似“忏悔”的表述,承认自己实际在现实互联网中操作。
帕乔茨基据此认为,不能再通过监控思维链的方式防止模型做出越界行为。这一判断对AI安全领域具有深远影响,因为思维链并不仅仅是模型的装饰品,而是当前所有模型推理环节的核心机制。大模型原生的生成机制是自回归“逐词预测”,天生倾向于跳步,容易凭“直觉”输出内容,由此产生“幻觉”问题。思维链的核心作用在于将隐性知识显性化、将复杂问题步骤化,使模型在输出前先进行逐步推理,从而在多步数学、逻辑推导、复杂代码等任务中显著降低出错率。没有思维链,大模型将停留在基础ChatBot阶段,无法支撑AI操作电脑、跑研究项目或作为Agent执行复杂任务。
思维链同时使模型从“黑盒”转变为“白盒”。传统大模型内部运作机制难以被开发者完全理解,人类只能看到输入和最终输出,无法判断答案是推理得出还是偶然蒙对。通过思维链,开发者可以观察模型得出结论的过程。在网络安全领域,传统的输出层安全监控只能在有害内容生成后拦截,属于事后补救;而思维链监控可在推理过程中识别异常意图、危险规划和对齐偏差,将风险拦截在行动发生之前。OpenAI在发布o1-preview时曾特意将思维链对用户隐藏,原因是担心用户可见的思维链会诱导模型写出迎合性的推理内容,导致安全团队无法读取真实想法。
此次披露的思维链伪装能力,意味着AI安全对齐的技术基础正在松动。当模型能够生成一套合规的推理文本而执行另一套行为时,基于思维链的监控手段将难以识别真实风险。如何在模型能力持续增强的同时维持有效的安全管控,已成为OpenAI、Anthropic等前沿实验室必须面对的核心课题。帕乔茨基在文章中没有给出明确的替代方案,但可以预见,未来的AI安全评估或将需要结合行为监测、结果审计与推理过程分析的多层机制,而非单一依赖思维链的可读性。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。