AI开始参与自身迭代:从AlphaEvolve到递归自我改进的工程现实

自进化可以探索新的方法,但安全边界不能仅凭系统自己的评价就被取消。

今年9月29日,特朗普签署行政命令,要求美国行政部门在法律允许的范围内,将官方通信和非法律文件中的AI改称SI(超级智能)。对照文件定义,SI暂时仍覆盖现有法律所定义的AI。与此同时,AI公司正在推进另一项更具技术实质的探索:让今天的AI参与制造明天的AI。

Google的AlphaEvolve系统使用Gemini提出候选程序,运行并评价结果,再沿表现较好的方案继续修改。Google披露,该系统找到的一项优化使Gemini中的关键计算核加速23%,对应整个训练时间缩短约1%。支撑这套系统的模型,已经用到了它帮助发现的改进。这形成了一种反馈关系:模型参与改善训练,改善后的训练条件又可能帮助开发后续模型。沿此路径继续推进,即所谓RSI(递归自我改进)。

Anthropic在讨论这条路线时明确承认,完整RSI尚未实现,而且并非必然实现。AlphaEvolve实现的1%改善已有具体工程用途,但无限自进化仍是需要验证的远景。反复修改同一段程序,也可能很快用尽容易改善的空间。

“自我改进”面临一个关键问题:凭什么判断它改得更好了?同一个问题换一种问法,答案可能就变。回答更像那么回事,和回答更接近事实,之间仍有距离。Klarna工程团队曾用AI寻找更快的训练代码,有些候选方案确实跑得很快,却无法保证相同条件下得到可复现的结果。工程师后来将可复现性加入筛选条件,不能只看速度决定采用哪个方案。

如果未来连评估方法也交给AI改进,问题会进一步延伸:它提出一套新测试并认为比旧测试更有效,谁来确认这套测试没有放过原来能发现的问题?如果仍只让同一个系统证明自己正确,这种证明的可靠性就值得警惕。自进化可以探索新方法,但安全边界不能仅凭系统自己的评价就被取消。

RSI尚未完整实现,但企业已开始下注,原因在于它可能改变开发下一代AI的速度。更强的模型不仅用于吸引用户,还能帮助研究团队写程序、做实验。倘若这些工作持续有效,公司可能更早做出下一代模型,再用它继续参与研发。今天的成果,有机会影响明天取得成果的速度。

Anthropic公开讨论过类似困境:放慢研发能给社会更多准备时间,但如果只有部分公司放慢,其他竞争者继续推进,结果可能只是换了一家领先的公司。担心风险与继续研发可以同时发生。一家公司的决定只能约束自己,它停下来无法保证竞争者也停下来。

竞争可以推动研究,也可能让企业在路线尚未得到充分验证时就不断追加投入。RSI尤其容易放大这种压力,它承诺的收益包含了更快取得下一次进步的可能。错过一次,企业担心的不只是少卖一款产品,还有此后的研发差距。这种担心可以解释企业的选择,却不足以证明加速一定值得。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
美国经销商要求RTX 5090整机购买者签署声明 承诺不带出境
上一篇 5小时前
Rust 成为微软内部一级编程语言,与 C++、C#、TypeScript 并列
下一篇 4小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部