腾讯混元发布Hy4 preview,大版本迭代周期压缩至两个月

Preview 不是一个版本标签,而是将真实使用纳入模型研发的行业机制。

8月28日,腾讯混元发布并开源Hy4 preview。从今年2月重建预训练与强化学习基建算起,混元将大版本的迭代周期压缩到两个月左右,已接近Anthropic、OpenAI、智谱等头部模型厂商的更新频率。区别在于,腾讯是在重建地基的同时跑出了这个速度。

版本间隔缩短的同时,混元能力跃升的幅度也在持续加大。Hy4 preview总参数达到770B,是Hy3的2.6倍;激活参数从21B提升至49B,上下文从256K扩展到1M。7月初,Hy3在软件工程实战基准DeepSWE上拿到28.0分,同期Claude Opus 4.8为58.0。不到两个月,Hy4 preview在同一项测试上拿到64.3,超过DeepSeek V4 Pro的62.7。同一天公布的Terminal-Bench 2.1上,Hy4 preview拿到85.4分,与Claude Opus 5持平。整体来看,混元在多项主流benchmark上均呈现显著上升曲线,尤其在长上下文任务、代码库重构、专业科学推理等更接近真实生产力的场景中追赶明显。

Hy4 preview发布当天,WorkBuddy和CodeBuddy同步开启两周免费体验。混元团队在说明中提到,希望通过Hy4 preview的尽快发布获得广泛的真实反馈,从而显著提升Hy4正式版。这一流程在Hy3时期已经完整走过一遍。4月23日,Hy3 preview开源上线,同时接入元宝、WorkBuddy、CodeBuddy、ima和QQ等多个业务产品。三个月后,Hy3正式版发布,团队表示preview已在50多个业务中获得广泛反馈,修复了大量体验问题,正式版在此基础上进一步提升后训练数据的质量与多样性,并扩大强化学习的算力规模。

对比preview版,Hy3正式版的幻觉率从12.5%降至5.4%,常识错误率从25.4%降至12.7%,多轮对话问题率从17.4%降至7.9%。这些改进并非单纯依靠增加参数实现。模型在真实任务中会犯一些具体错误,比如忘记用户几轮前提出的限制、工具调用失败后盲目重试、任务完成后不知道何时停止等。只有将模型放入产品中持续面对真实用户,再把失败过程拆解、定位问题环节、补充正确的任务轨迹和判断标准,错误才能被逐条纠正。

Preview并非混元独创的发布方式。2022年,OpenAI将ChatGPT作为research preview推向公众,通过收集用户反馈了解模型在真实世界中的优势与局限,后续的o1-preview、GPT-4.5也延续了相似策略。OpenAI将其称为“迭代式部署”:不是等系统在实验室里变得完美再推出,而是让仍有不足的版本受控地进入真实世界,再根据实际使用不断修正。如今,分阶段开放、早期测试和preview-first已成为前沿模型常见的研发机制。

Hy4 preview的官方说明中提到,模型能力的提升来自与腾讯内部软件工程、游戏、金融、安全等领域专家的高质量数据共建。Hy3时期重点是与CodeBuddy、WorkBuddy等产品深度协同,把真实任务中的用户反馈和失败案例送回训练环节。到了Hy4阶段,来自各专业领域的专家共建被放到更靠前的位置。这是两个不同层次的反馈:用户告诉模型“哪里不好用”,专家告诉模型“什么才算真正做好”。一个金融分析任务,普通用户只能判断报告能否使用,专业人士还能判断统计口径是否一致、证据链是否完整、风险提示是否充分。一个软件工程任务,测试通过不等于代码可以合入,工程师还会考察架构、可维护性、性能和潜在回归。

让产品反馈和专家判断参与模型训练的方法,腾讯内部称为Co-Design。什么信息该给模型、何时给、以什么结构给,模型可调用哪些工具、如何判断任务完成、失败后如何恢复——这些都不是模型团队在实验室里能独立想明白的。Co-Design让多方共同定义问题,而非等模型训练完成再由产品接入API。混元内部建立了50多套评测,用真实考题、人工评测和产品众测进行验收,不再把外部排名作为唯一标准。混元团队认为,真正有价值的进步来自产品侧回流的真实Prompt分布:模糊提问、多轮追问、省略表达、隐含意图、前后矛盾,以及用户自己都没有完全说清的需求。用户提供问题分布,专家提供质量标准,产品提供任务环境,模型团队再将三者转化为后训练和评测体系。

WorkBuddy的界面上陈列着多个厂商的十余款模型,混元、DeepSeek、GLM、Kimi、MiniMax均可一键切换。每一次切换都是一次投票,每一次重复使用也是一次投票。结果是Hy3留住了用户。今年7月8日,Hy3正式版在WorkBuddy上线后,调用量一度打满算力,当天下午排队率超过50%,团队紧急扩容,原定两周的免费体验也因需求过大延长至8月底。自上线WorkBuddy以来,主动选择Hy3 preview的用户数量增长了6倍。接入Hy3正式版后,WorkBuddy内部测评的任务成功率从72%提升至90%,平均耗时缩短34%。

在多模型共存的产品中,混元获得的不只是“好用”或“不好用”的判断,而是一组带对照关系的反馈:同一任务,不同模型用了多长时间、采取什么路径、调用哪些工具、在哪一步失败、用户最终接受哪个结果。这使得WorkBuddy不只是混元的考场,也成了它的训练场。混元已接入腾讯内部多个业务产品,以真实使用场景持续驱动模型迭代,其追赶路径在行业中有一定参考意义。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
OpenAI提交新请愿书要求驳回苹果窃密诉讼 法院将于10月审理
上一篇 16小时前
微软失去成长性?
下一篇 2022年8月1日 上午8:30

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部