AI for AI 成头部实验室竞逐焦点,中训练与后训练成最先落地场景

基座不变,模型照样能大步向前,差距正越来越多地产生在基座之后。

2026年,AI for AI 已成为海外头部实验室公开竞逐的核心方向。OpenAI 于9月宣布其 AI 具备“自动化研究实习生”能力,并成立 RSI(递归式自我改进)团队,目标在2028年3月前实现完全自动化的 AI 研究员。Anthropic 在6月发布的《When AI Builds Itself》报告中披露,其内部80%以上可运行代码已由 Claude 独立编写,工程师产出效率提升8倍;9月最新进展显示,其内部核心研发平台上有30,000个 AI Agent 同时协作,持续进行代码跑测与算法实验。Google 则推出自进化编码智能体 AlphaEvolve 加速 Gemini 迭代,同时经历人事调整,哈萨比斯卸任 Google DeepMind CEO,转战 AGI 长期战略及 Isomorphic Labs 的 AI 药物研发,Jeff Dean 离职创办 Discovery Loop 专攻自动化机器学习,数周内估值达500亿美元。

国内方面,AI 参与 AI 研发的实践密集出现,切入环节各有不同:面壁用 AI 编写预训练框架,智谱让 AI 搭建国产芯片上的推理基础设施。Naive AI 则将这些环节串联,架构探索、训练系统、推理优化均有 AI 参与,模型本身也被专门训练以承担研发工作。该公司创办7个月,估值升至14.2亿美元。

要理解这一路线,需区分模型研发的不同阶段。预训练将模型“做出来”,投入大、周期长,一次完整实验往往以月计。中训练与后训练则将模型“做强”,在已有基座上用数百亿到数万亿 tokens 的高质量数据生长出目标能力。中训练与后训练由大量实验构成,涉及注意力结构调整、长上下文扩展、推理速度优化等,实验多、周期短、结果可快速评估,因此成为 AI 最先能够大规模承担研发工作的环节。

开源生态的成熟为这一路径提供了可行性。DeepSeek、Qwen 等高质量开源基座陆续发布,团队可基于此启动研发,模型差距越来越多地来自基座之后的那几步。智谱 GLM-5 在27T tokens 预训练后,专门安排约1.55T tokens 的中训练,分32K、128K、200K 三段逐步拉长上下文。今年8月发布的 GLM-5.3 沿用与 GLM-5.2 相同的基座,不再重新预训练,能力提升全部来自后训练,主要依靠强化学习,内部编程评测成绩提升约50%。

Naive AI 押注的正是中训练与后训练路线。其 Naive-N0.5-Flash 重构了基座注意力架构,保留滑动窗口注意力处理局部信息,将全局注意力层替换为稀疏注意力,形成每5层 SWA 搭配1层 DSA 的混合结构,整个网络不再含有全局注意力。模型全程保持1M 上下文,分三阶段累计训练3.25T tokens:索引器预热阶段冻结其余参数,仅训练新加入的 DSA 索引器;稀疏注意力训练阶段进行大规模继续预训练,强化编程与 AI 研发能力;学习率衰减阶段进入 SFT,让能力稳定成型。训练系统本身也在被 AI 优化,例如针对 DSA 层与 SWA 层的不同上下文需求提出分工方案,降低长序列通信开销,并在显存管理上细化到算子级别,提升1M 长序列下的显存效率。

从行业整体看,AI for AI 已从概念走向工程落地。以 Devin、Aider、OpenHands 为代表的研发智能体逐步成熟,机器学习工程成为递归式自我改进的核心试验场。中训练与后训练作为当前最先被 AI 大规模接手的研发环节,正在验证一条路径:在有限资源内持续突破性能边界,或将成为通往 AGI 的重要增长曲线。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
生成式搜索引擎重塑流量入口,企业内容策略转向GEO优化
上一篇 18小时前
独家丨上汽集团高层换防:俞经民升职,尚界一把手换人
下一篇 17小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部