9月30日,Google DeepMind研究员Zirui Wang在社交媒体上表示,其团队新发布的模型已正式超越他本人的能力。当天,谷歌发布Gemini 4系列首款模型Gemini 4 Argon,这是谷歌今年最重要的旗舰模型发布。这一表态随即引发业界对谷歌是否已实现RSI(递归式自我改进)的猜测与讨论。
RSI指AI参与改进自身或研发下一代AI的能力。目前,多家公司已将RSI纳入研究目标和投资叙事,相关论文、评测基准和产品正密集出现。谷歌是其中投入最大、行动最激进的公司之一。仅在9月,谷歌就连续公布了四项相关进展,涉及模型研发、搜索策略和智能体工作流等环节。
密集布局的背后是谷歌在大模型竞赛中的紧迫感。不到一年时间,Gemini从登顶榜单滑落至被部分用户揶揄为“美国豆包”。旗舰模型延期、核心人才流失、编程智能体等关键方向被竞争对手率先定义,谷歌面临的风险已从单轮模型落后演变为逐渐失去行业节奏。据Business Insider报道,谷歌联合创始人谢尔盖·布林对Gemini的进展并不满意,并推动团队将更多精力投入RSI。
RSI看似是“AI改进AI”,但行业至今未形成统一定义,争论主要围绕三个问题展开:AI究竟能改进什么、一次改进能否降低下一次进步的成本、如何证明改进真实有效。
在改进对象上,Anthropic将代码智能体视为RSI的前置阶段,认为只有当模型能较为自主地完成训练、评估和后继系统开发时,循环才算真正闭合。OpenAI关注研究工作自动化程度,于9月6日宣布达到“自动化研究实习生”阶段目标,并计划在2028年3月前进化为“自动化AI研究员”。谷歌的理解则更偏向系统工程,认为只要AI能持续改进训练代码、算法、工具链、芯片设计和数据中心调度,并用这些收益缩短下一代模型开发周期,递归效应就可能出现在整套研发系统中。
在迭代效率上,Google DeepMind研究员姚顺宇指出,RSI是一个连续光谱,而不是某个突然到来的时刻。真正的递归效应要求一次成功能够提高后续搜索、实验或研发的效率,例如训练内核加速可缩短下一代模型训练时间,数据中心释放更多算力可支持更多实验。
在验证机制上,代码能否编译、内核提速多少、内存节省多少均有相对明确的标准,但模型是否获得可迁移到新任务的能力、自动生成的训练方法是否优于原方案,往往更难判断。近期,Scale AI推出的RSI Bench、聚焦算法设计的AI4AI-Bench,以及覆盖GPU内核、训练、推理和服务等领域的Φ-Bench,都在测试RSI所需的前置能力。
过去一个月,谷歌原本散落在模型、智能体、搜索策略、芯片和数据中心等环节的RSI投入开始汇合。9月2日发布的Gemini 3.8 Flash释放了直接信号,谷歌称长时间运行的智能体循环参与了该模型的开发。姚顺宇评价,这是模型能力的“一小步”,却是RSI的“一大步”。
9月14日,谷歌与两所美国高校的研究者发布Dream-RSI,为智能体配备持续更新的“探索地图”,记录每次尝试的代码、报错、运行时间和最终得分,从而判断哪条路值得继续、哪条路应放弃,减少研发中的无效试错。一周后的9月21日,谷歌云AI研究团队联合三所美国高校发布RRSI,让AI参与改造自己的操作台,根据任务反馈修改提示词、增减工具调用、重新拆分任务或调整多智能体分工。Dream-RSI解决“往哪里走”,RRSI解决“怎么把活干好”。
更早发布的AlphaEvolve已将这套思路带入生产系统。Gemini批量提出候选方案,评估器逐一测试,系统保留表现更好的版本并继续探索。目前,AlphaEvolve已进入谷歌的数据中心、芯片和AI训练流程。今年7月10日,谷歌将AlphaEvolve正式推向Google Cloud商用,自动优化从内部研发工具扩展为对外平台能力。
对谷歌而言,RSI既是技术路线,也是资本回报逻辑。8月初,Google DeepMind首席战略官Jasjeet Sekhon在伯克利Agentic AI峰会上表示,RSI是当前巨额AI投入背后的核心投资逻辑之一。2026年,Alphabet将资本开支指引上调至1950亿至2050亿美元,大部分资金将用于服务器、数据中心和网络设备。谷歌需要证明这些资源不只能服务搜索、广告等核心业务,也能持续提升自身研发效率。RSI提供的正是一种复利效应:算力扩大研发能力,更强的研发能力又反过来提升算力利用效率。
从模型外围入手、在容易衡量的环节积累改进、再将收益带回模型研发,是谷歌现阶段推进RSI的核心思路。随着模型、智能体与基础设施开始彼此连接,一条RSI研发生产线正在谷歌内部成型。这条路线能否帮助谷歌重新夺回行业节奏,将取决于其在改进对象、自主程度和验证机制三个维度上的实际进展。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。