大模型军备竞赛在9月初的72小时内进入白热化阶段。9月1日至4日,Anthropic、谷歌、Meta、阿里和OpenAI五家头部厂商密集发布或升级旗舰模型,竞争焦点高度集中于软件工程与编程能力。
当地时间9月1日,Anthropic推出Claude Fable 5.1与Claude Mythos 5.1,定位为“目前面向编程和知识工作的最强模型”,编程跑分较前代翻倍。前者面向普通用户开放,后者仅通过可信访问计划(Trusted Access Programs)提供。9月2日,谷歌发布Gemini 3.8 Flash和Gemini 3.8 Flash Cyber两款模型,在价格不变的前提下提升软件工程和Agent工作流表现,距其3.7 Flash更新仅三周。同日,Meta更新Muse Spark 1.3,聚焦长周期Agent任务与复杂上下文处理。阿里同步升级Qwen3.8-Max,重点强化编程与办公能力。北京时间9月4日凌晨,OpenAI正式推出GPT-6 Astra,称其为“迄今为止最强的软件工程模型”,总裁格雷格·布洛克曼以“欢迎来到AGI时代”作评。
若将时间轴拉长,腾讯于8月28日发布混元Hy4 preview,智谱于8月14日发布GLM-5.3,编程能力较前代提升50%,7月发布的Kimi K3亦因编程测评得分超越当时Anthropic主力模型而引发关注。密集迭代背后,各厂商策略呈现分化与收敛并存的特征:API价格向平均水准靠拢,中国模型提价而美国顶尖模型订阅成本下降;能力侧重点则同时向办公、科研等Agent自主工作场景延伸。
编程之所以持续被置于模型能力迭代的核心,在于代码产出结果的可验证性。相比写作、设计或策略建议,代码运行效果可进行相对清晰的比较。同时,编程天然适配Agent工作流——开发本身就是一条完整的、机器最熟悉的自动化链路。当前各厂商的Agent编程已相对成熟,下一步竞争或将指向“自动驾驶”级的多Agent协作,完成全流程开发、测试、部署与运维。
编程作为“元能力”的扩散路径同样受到关注。智谱在8月31日业绩说明会上回应“Coding三连问”时表示,编程能力已在网络安全领域率先突破,GLM-5.3的一大重点即漏洞发现,后续计划将长程规划、工具调用和错误恢复能力迁移至数据分析、法律、金融等高价值专业场景。摩根士丹利分析认为应重点关注编程能力向Co-work等领域的扩张。智谱给出的模型能力演进判断为Chat→Coding→Agent→Co-work→Autonomous AI,目前公司重心处于第二级至第四级之间,最终指向无人值守条件下承担长期目标的Autonomous AI方向。
OpenAI的Astra已直接切入端到端自动化,聚焦在专业软件环境中完成完整任务并持续改进。从代码交付到任务交付的转变,被视为AI真正进入企业业务流程的关键一步,而刚刚过去的72小时或仅是这场编程能力巅峰之战的开端。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。