智谱GLM-5.3对决DeepSeek V4 Pro:国产大模型自进化路径分叉

自进化是公认通往AGI的赛道,眼下国产大模型的AGI赛道,本质上就是智谱、DeepSeek、Kimi三家的竞速。

8月14日,智谱发布GLM-5.3,当日股价下跌3.57%,日内回撤超11%,与GLM-5.2发布当天暴涨32.8%、一周后市值突破万亿的走势形成鲜明反差。尽管市场反应冷淡,GLM-5.3的性能数据却颇为亮眼:DeepSWE基准得分66.9分,超过V4 Pro的62.7分;Terminal Bench 3.0从5.2版本的4.6分跃升至28.3分,拿下开源模型第一;CyberGym以84.5%的得分登顶全球。在高难度编程任务上,GLM-5.3仅用不到Claude Opus 4.8一半的token,便取得了更高的完成率。

值得注意的是,GLM-5.3并非全新基座模型,它与GLM-5.2共用同一个7430亿参数基座,所有性能提升均来自后训练环节。这一逻辑与DeepSeek V4 Pro从预览版到正式版的迭代路径一致——后者同样基于1.6T参数基座,能力跃迁完全依赖后训练。两家公司的方法论差异在于定价策略:智谱维持原价,而DeepSeek自8月17日0点起全面调整API价格,引入峰谷分时定价机制,整体价格较此前大幅上调,全计费项涨幅区间为50%至1100%。

两家头部大模型公司的技术路线已形成初步交锋,核心战场是自进化。智谱在GLM-5.3中引入了一套“环境合成流水线”,本质上是让模型自己出题、自己判卷。具体机制为:一个“AI研究员”研究Agent进入真实场景采集工程师的工作流程,将实际任务转化为训练题目;随后一个“AI判卷员”判断Agent在不参考标准答案的前提下,仅依据解题轨迹验证题目可解性,排除无解题、缺条件题和条件矛盾题。只有通过“题能出、能做、过程干净”三道关卡,题目才进入训练题库。

这套流水线使训练环境规模扩大数倍。在基础设施层面,智谱对训练框架slime进行了两层改造。算法层面,练习与考试环境的计算结果平均差异控制在千万分之一量级,较此前精确了99.99%,避免强化学习万轮循环中的误差累积。系统层面,智谱增加了数据缓存、多任务调度和题型自适应配置等优化,长程编码任务的整体训练速度提升2.3倍。在Agent领域影响力最大的Terminal Bench 3.0基准上,GLM-5.3得分从5.2版本的4.6分暴涨至28.3分,拿下开源第一;DeepSWE v1.1从46.2分涨至66.9分,Agents’ Last Exam从23.8分涨至28.5分,AutomationBench从26.2分涨至48.2分。

DeepSeek V4 Pro正式版同样强化了后训练。预览版的监督微调数据以通用问答和基础代码为主,正式版则新增大量Agent专用的多步骤工具调用对话范例,训练样本从“帮我写封邮件”式的一问一答,转向“把文件夹里所有PDF转成Word”式的完整任务链。同时,DeepSeek重新设计了GRPO强化学习的奖励函数,针对预览版在Agent场景下的工具调用死循环和参数解析错误两类硬伤设置专门惩罚机制。在需要35次工具调用的复杂任务中,正式版基本可以一次跑通不再卡死。

两家公司的技术路线差异背后是创始人的理念分野。智谱创始人唐杰在7月11日发布内部信《巨浪已来》,宣布启动“Touch High(摸高)计划”,未来两年不将重心放在商业变现上,集中资源冲刺AGI下一个高地。唐杰将AGI突破拆解为三座必须翻越的大山:记忆,长上下文和RAG已逼近记忆雏形;完全自治的智能体系统,即持续学习和自我评判;自进化。唐杰在信中表示,“AI训练AI已经成型,模型自己写代码、自己清洗与合成数据、自己训练自己。这或许会消耗一些算力,却节省了人力。”

自进化被普遍视为通往AGI的核心赛道,当前国产大模型的AGI竞赛实质上集中在智谱、DeepSeek和Kimi三家之间。智谱强调通过自动化环境合成提升训练数据质量,DeepSeek则侧重通过奖励函数设计优化Agent行为表现。两条路径的最终目标一致——让模型更像一个能独立完成任务的“人”。随着GLM-5.3与V4 Pro正式版相继落地,国产大模型在自进化方向上的竞争正进入实质性阶段。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
DeepSeek上调API价格最高12倍,大模型定价体系进入分层时代
上一篇 2小时前
苹果招聘演播室制片人 Fitness+健康服务或推直播内容
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部