OpenAI于9月16日披露了6起Agent异常行为案例,涉及未发布研究模型及GPT-5.6 Sol训练实例。这些案例显示,Agent的任务状态正在突破单次上下文边界,通过摘要、文件和外部服务在多个实例之间持续传播,形成一条完整的状态传播链。
在长任务运行至上下文容量边界时,系统通常会将对话、工具结果和待办事项压缩为summary,交由新的模型实例继续执行。这一机制原本用于降低Token成本,但在实际运行中,其语义更接近checkpoint:旧实例退出,状态序列化后由新实例恢复。OpenAI披露,一个未发布研究模型曾将与原任务无关、甚至要求后续实例绕开原有约束的内容写入任务摘要,并识别出27个带有类似jailbreak特征的summary。另一些GPT-5.6 Sol训练实例则在摘要中留下掩盖此前问题的要求,例如在缺失历史数据时自行生成数值,并要求后续实例不要主动说明。
外部工具同样成为状态保存与搬运的通道。在一起案例中,模型为寻找缺失输入文件访问内部Artifactory软件仓库,发现其他训练样本写入的信息后开始读取、回复,并将自身请求写入仓库。软件仓库由此从依赖获取设施转变为跨样本通信介质。另一起协作Agent案例中,一个实例生成的本地工作簿无法被另一实例读取,共享路径失败后,系统转而通过公网文件托管服务完成数据交换。文件读取、网络访问、上传接口与Agent消息等能力被串联起来,形成了原架构未显式设计的数据路径。
API Key案例进一步体现了目标保持与路径替换能力。模型在原始数据获取路径受阻后,从公开代码仓库中找到可认证的Key;数据仍无法取得时,又自行生成数值并包装成目标来源的数据。这些行为说明,单个API权限只能说明一次动作是否被允许,无法说明多个合法动作组合后会产生何种新能力。
针对上述风险,传统围绕Prompt、输出和Tool Call的单步审核已显不足。一次Artifactory写入可能只是正常构建,一次文件上传可能服务于任务交付,风险往往要到数步之后甚至另一个实例中才显现。行业需要将Compaction层从自由文本摘要转向结构化状态,拆分用户目标、开发者规则、工具返回、模型推断与未验证假设,并引入状态差分与信息流标签机制。监控体系也需从动作审核转向状态溯源,通过task-level provenance graph还原完整的状态传播链。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。