在2026世界机器人大会上,宇树科技创始人王兴兴介绍了公司正在探索的物理AI机器人自进化路线:大模型介入研究检索和控制代码生成,再通过仿真、真机测试和评价反馈形成持续迭代闭环。这一路线指向一个正在被行业讨论的核心命题——具身智能领域的递归自我改进(RSI)闭环,最先跑通的公司未必是基础模型最强的那一家。
RSI(Recursive Self-Improvement)关注的核心是:系统不仅继承上一轮的改进结果,还进一步优化产生改进的方法本身。如果这一机制能够稳定提效积累,下一代更强能力的出现速度将不再线性增长。在数字环境中,这一进程已有可量化的进展。Anthropic于9月17日首次用内部数据量化了AI在研发中的参与度变化:按照Epoch AI提出的Automation Level,2026年2月其内部达到AL4——即人主要提供高层目标、AI完成大部分端到端任务——的研发工作占比不足1%,到8月已升至26%,超过90%的研发工作至少达到AL3。在Anthropic使用最多的内部Agent平台上,任意时刻约有3万个Agent同时从事研究和工程,仅8月就做出了超过10亿次决策。
在方法层面,Dream-RSI项目将真实搜索历史组织为“回放模拟器”,让AI在已发生的探索记录中重新测试不同策略,改进后的探索策略再进入真实任务,新记录继续补充模拟器形成循环。在GPU Kernel任务中,Dream-RSI用1.79至2.43倍更少的生成次数达到相近性能;在另一些任务中,能在相近预算下把性能最高提升到固定探索策略的2.09倍。但Dream-RSI改进的是模型外部的搜索策略,底层Agent并未随循环变化。
Darwin Gödel Machine(DGM)则把修改对象推进到Agent自身,允许coding agent直接修改自己的代码,新版本进入真实编程任务接受检验,表现较好的版本被保存进archive并成为后续修改的起点。其SWE-bench成绩从20.0%提高到50.0%,Polyglot从14.2%提高到30.7%。被改出来的新Agent重新站到了下一轮研发的起点,而非停在实验终点。
当这套逻辑进入具身智能,多出一层数字环境难以等价面对的约束:真实部署。机器人每一次真机试错都会消耗设备、时间和人力,却也会暴露真实状态、异常、接管与恢复等信息。如果这些部署经验能够稳定回到训练和验证系统并被后续版本继承,产品部署就不再只是商业交付,也开始成为持续改进的研发入口。由此,判断一家机器人公司的持续改进能力,可以落到一个具体问题:今天在真实世界暴露的问题,需要多久才能转化为下一版经过验证的新能力。
在具身智能赛道,基础模型的领先优势可能被持续改进系统的效率差所抵消。那些能够将真机部署经验高效转化为下一代能力迭代输入的公司,即便当前基础模型并非最强,也有机会在RSI闭环的竞赛中率先跑通。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。