2026年以来,OpenAI、Anthropic、谷歌DeepMind三家头部AI公司相继曝出模型在评测中突破环境隔离的事件,同时其安全对齐团队正在经历一轮罕见的人事动荡。据公开信息,OpenAI安全系统团队负责人约翰内斯·海德克(Johannes Heidecke)于2026年7月离职,这已是两年内第六位离开OpenAI的高级安全负责人。Anthropic与谷歌DeepMind也在同期进行了安全团队的组织调整与人才引进。
OpenAI的安全团队架构在过去两年经历了多次反复。2023年7月成立的超级对齐团队,专为“比人更聪明的AI”研究对齐方案,于2024年5月解散。联合领导该团队的扬·莱克(Jan Leike)离职时公开表示,OpenAI近年来将算力和资源集中投向产品团队,对安全与对齐的重视不足。此后成立的“使命对齐”小组由在OpenAI工作九年的约书亚·阿基阿姆(Joshua Achiam)领导,2024年9月成立,2026年2月再度被解散,六名成员被分散至研究与产品团队。
2026年7月与海德克同期离职的还有阿基阿姆。此后,首席研究官马克·陈(Mark Chen)宣布安全团队统一向原对齐负责人米娅·格蕾丝(Mia Glaese)汇报,后者升任“研究与安全”副总裁。马克·陈表示,这一调整旨在让安全“更早、更直接地介入关键模型、产品与发布决策”,同时承认安全团队面临的压力持续上升:“我们训练模型的速度快得多,发布周期也大幅缩短。结果是,今天围绕安全的协调问题,比以往任何时候都更大。”
Anthropic方面,莱克加入后牵头组建并领导“对齐科学”团队,研究方向包括可扩展监督、弱到强泛化、越狱鲁棒性以及自动化对齐研究。2026年1月,原OpenAI“模型政策”研究团队创办人安德烈亚·瓦洛内(Andrea Vallone)加入该团队,直接向莱克汇报,负责对齐与微调、塑造Claude在新情境下的行为。2026年5月,OpenAI联合创始人、前特斯拉Autopilot负责人安德烈·卡帕西(Andrej Karpathy)加入Anthropic预训练团队,组建“用Claude加速预训练研究”的小组。6月,谷歌DeepMind从事机制可解释性研究的亚瑟·康米(Arthur Conmy)也宣布加入,称其目标是在模型训练过程中完成对齐。
谷歌方面成立了AGI安全与对齐团队(ASAT),负责人为罗欣·沙阿(Rohin Shah),其背景为UC伯克利人类兼容人工智能中心(CHAI)博士。ASAT隶属于DeepMind的“AI安全与对齐”部门,定位是不做面向当下产品的补丁式修复,而是专攻更先进AI带来的更严重危害,目标是降低AI的存在性风险。值得注意的是,ASAT在7月公开招募多个岗位时,要求应聘者另填一张特殊表格以绕过谷歌自家的AI简历筛选,理由是罗欣·沙阿不信任自家的AI筛选器。
安全对齐包含两个层面。对齐(Alignment)指让AI的目标与人类真正想要的结果保持一致,不仅要求模型“听得懂指令”,还要求其符合人类预期,例如不能撒谎、不能表面合规而暗中偏离。安全(Safety)则指让AI不造成伤害,既包括模型自身失控,也包括被恶意滥用以及大规模部署后的系统性风险。对齐是安全的底座,但安全不止于对齐。一个模型可以对齐良好却仍不安全,也可以能力很强却因对齐失败而闯祸,因此行业通常将两者合称为“安全对齐”。
当前安全对齐面临的核心问题是:模型能力可以通过数据和算力持续堆叠,但当AI的能力超越人类时,人类凭什么信任它。OpenAI组建超级对齐团队时曾表示,目前没有任何方案能够控制可能失控的超级智能。与模型性能拥有大量基准测试集、可通过跑分直观比较不同,安全对齐至今缺乏统一的量化评估标准。行业目前主要围绕可扩展监督、弱到强泛化、越狱鲁棒性和自动化对齐研究等方向展开工作。
从三家公司的团队调整来看,安全对齐正在从独立的研究职能转向嵌入前沿模型开发流程。OpenAI将安全并入前沿模型开发线,Anthropic通过对齐科学团队直接参与模型训练与行为塑造,谷歌ASAT则聚焦长期存在性风险。这一趋势反映出行业对安全介入时点的重新判断:安全不再被视为发布前的最后一道检查,而是需要在训练阶段就参与其中。但团队频繁重组、负责人持续流失的现实,也说明安全对齐在组织资源和发布节奏之间仍面临结构性张力。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。