据Arena最新发布的Alignment Index(对齐指数)榜单,腾讯混元最新模型Hy4 Preview以78.5分位列全球第五、中国第一。该榜单基于超过9万条真实Agent会话、覆盖27个模型,专门评估模型在真实使用场景中的安全表现。OpenAI的GPT-6.1 Sol以87.9分位居榜首,Anthropic的Claude Opus 5.5(83.2分)和Grok-4.7(82.7分)分列二、三位。
与传统的跑分榜单不同,Alignment Index聚焦三类失败信号:越权(Unauthorized Action)、错误归因(False Attribution)和虚假完成(Deceptive Completion)。越权指模型执行用户未授权的操作,如绕过安全护栏或删除文件;错误归因指模型将用户未表达的意图或事实归到用户头上;虚假完成则指任务未完成却报告已完成。数据显示,虚假完成是三项中最普遍的问题,平均每10个会话出现1次,在代码调试场景中比例高达48.0%。Hy4 Preview的越权率为1.47%,为中国实验室中最低;虚假完成率为13.24%,高于10%的平均水平,仍是该模型需要补足的短板。
此次榜单成绩与腾讯近期在AI组织架构上的调整密切相关。今年9月,腾讯TEG内部任命姚顺雨正式兼任AI Data部负责人,向TEG总裁卢山汇报。该部门主要负责大模型数据和评测体系建设。此前自上半年起,姚顺雨已实际管理该部门。至此,腾讯混元的模型、Infra、数据和评测四项职能均划归其一人统筹。
姚顺雨此前在《The Second Half》一文中提出,AI下半场的瓶颈不再是模型训练,而是如何让模型符合用户真实需求。他认为传统评测方法存在局限:题目独立同分布,而现实任务顺序发生、经验积累,Agent必须在全程与人互动。Hy4 Preview在训练中让模型参与训练方法、数据策略、评估体系和底层算子的自动优化,并与WorkBuddy、CodeBuddy等产品共同设计,训练数据来自腾讯软件工程、游戏、金融、安全团队的实际业务场景。
Alignment Index的推出反映出AI行业叙事正在从“谁更强”向“谁更安全可控”转移。头部模型在基准测试上的分数日益接近,安全与对齐能力正成为用户选择模型的新依据。Arena数据显示,对话越长问题越多:在20条以上用户消息的会话中,虚假完成比例升至45.4%,越权升至12.4%。随着Agent承担更多长任务,对齐问题正成为行业面临的核心挑战。与此同时,对齐能力也在影响中国模型的出海路径,国内AI厂商正从自建海外API转向通过AWS等海外云平台上架模型、按调用量分成的模式。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。