马斯克和腾讯,在AI这件事上,居然踏进了同一条河流。就在昨天凌晨,SpaceXAI发布了Grok 4.6,独立评测机构Artificial Analysis给出的智能指数是61分,追平了ChatGPT-5.6 Sol,紧咬Fable 5 Max的62分。更扎眼的是成本,每任务0.84美元,比Sol的1.23美元和Opus 5的2.34美元便宜一大截。马斯克两小时转了十几条推文,放话称综合考虑智能、速度和成本,Grok 4.6客观上是第一名,还预告Grok 4.7将超越所有现有模型。就问你,五个月前那个差点吃散伙饭的xAI,现在这逆袭剧本,喜不喜欢?
今年3月是马斯克的AI至暗时刻。Grok 4.3被硅谷御三家甩开,xAI的11位联合创始人走了10个,马斯克公开承认“第一次构建失败了”。但五个月后,谷歌陷入模型掉队和人事震荡,Gemini被戏称为“美国豆包”,Grok却像猎鹰火箭一样窜天。这转折靠什么?不是运气,是他花了600亿美元收购的Cursor——一个AI代码编辑器。3月12日,xAI创始团队清零的同一天,Cursor两位高级产品工程负责人宣布加入xAI,直接向马斯克汇报。4月,SpaceX和Cursor签署算力与联合开发协议。6月,SpaceX刚完成史上最大IPO四天后,宣布行使收购Cursor母公司的选择权,同时还透露,过去几个月一直在和Cursor联合训练一个模型。
Grok逆袭的脚本,就是这个“联合训练”写下的。SpaceX在SEC文件里讲得很清楚:软件开发是AI的黄金场景,因为具备高质量结构化数据、快速反馈周期和高频使用。AI编程产生的工作轨迹,反过来改善模型训练和性能。这是一条正反馈回路——用户拿Grok干活,Cursor记录它怎么干、哪里失败、哪里补救,工程师把这些真实任务行为轨迹加工成训练和评测数据,经过强化学习让模型变强。效果快得惊人:7月Grok 4.5发布,编程能力追平GPT-5.5,价格只要一半;一个月后Grok 4.6又来了。这个配方,Anthropic早就验证过了——2025年2月,Claude发布sonnet3.7时同步推出Claude Code编程助手,从此一路开挂,不到一年反超ChatGPT。
有意思的是,在Grok逆袭的同一时间,腾讯也找到了自己的Co-design Loop。Grok 4.6发布前几个小时,腾讯财报电话会上重点讲了WorkBuddy和混元的协同设计。跟马斯克花大价钱收购成熟业务不同,WorkBuddy是腾讯内部小团队在AI编程智能体CodeBuddy上改造出的AI办公智能体,趁着3月的“龙虾热”快速崛起。6月月度访问量达到2097万,在国内桌面AI办公智能体中排名第一,超过第二、第三名之和。这场景比编程更大——写PPT、整理文档、处理表格、搜索资料、跑代码、调用工具,每天产生海量真实工作任务。用户的一次失败任务,往往比Benchmark里一个错误更有价值,因为它告诉模型到底为什么失败;一次成功任务,可以拆成一条可复用的Agent轨迹。这让模型训练得到一种稀缺资源:真实世界的任务分布、操作轨迹、失败案例和最终结果。
负责重建混元的姚顺雨,一年多前就在《AI下半场》里提过:大模型强化学习有了泛化能力后,模型评估比训练更重要,而做好评估需要开发面向现实世界效用的全新任务。所以重建混元一开始,他就提出了Co-design方法,让模型跟产品深度协同优化。刘炽平在电话会上肯定了效果:“通过持续把真实产品使用和领域反馈注入模型训练,我们的‘模型-产品Co-design’方法让混元得以验证模型精度、识别并解决边缘场景,实现更快的模型迭代。”混元4月底Hy3 Preview亮相,7月正式版发布,在Agent、推理和编码等任务上进入国产第一梯队,用295B小参数实现性能对标大参数竞品。刘炽平还罕见地公开喊出“追求SOTA大模型”——Hy4将是更大规模模型,目标是逐步逼近行业最先进水平。几个小时后,马斯克也立下SOTA的flag,认为SpaceX训练语料库如此出色且独特,如果任何模型在现实世界工程方面比Grok 4.7更好,他会感到震惊。
这种Co-design Loop的出现,确实让大模型后发者看到了赶超希望。Meta最近推出首款编程Agent Muse Codem,搭载新一代模型Muse Spark 1.2,定价策略很特别:贡献者版比标准版便宜95%,条件就一个——允许Meta用开发者的编程数据训练未来模型。小扎虽迟但到,小心思肉眼可见。但跟硅谷不计成本的大模型竞赛相比,国内AI行业更看重投入产出比,所以Co-design Loop更大的价值在于:这可能是AI大模型第一次出现类似互联网平台的网络效应——用户增长带来数据,数据带来模型能力,模型能力又吸引更多用户。马斯克欣赏微信,买下推特后心心念念要把它改造成万能应用,去年底直接把X定位成“WeChat++”。这回在AI上,他又跟腾讯踏进了同一条河流。被验证的系统,永远比单独的模型或产品更重要,就问你认不认?
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。