EinsiaAI近日发布了一项名为AI4AI-Bench的基准测试,旨在评估AI系统能否设计出比自身更优的AI。该基准测试覆盖了包括GPT-4o、Claude 3.5 Sonnet和Gemini 1.5 Pro在内的多款主流大模型,结果显示所有参测模型在自我改进任务上的表现均不理想,得分最高的模型也仅为0.16分(满分1分)。
AI4AI-Bench的设计思路源于AI领域一个长期存在的理论问题:如果AI能够理解自身的工作原理,是否能够在此基础上提出改进方案,从而设计出性能更强的下一代AI?EinsiaAI的研发团队将这一抽象问题拆解为三个具体的评估维度:架构理解能力、改进方案生成能力以及改进效果验证能力。
在架构理解维度上,模型需要准确描述给定神经网络结构的计算流程和参数作用;在改进方案生成维度上,模型需要针对特定性能瓶颈提出具体的架构调整建议;在改进效果验证维度上,模型需要预测所提改进方案对模型性能的实际影响。三个维度的得分加权汇总后形成最终评分。
从测试结果来看,所有参测模型在架构理解任务上的表现相对较好,能够较为准确地描述常见的深度学习模型结构,但在改进方案生成和改进效果验证两个维度上得分极低。EinsiaAI在技术报告中分析指出,当前大模型虽然具备对AI技术的表层知识,但缺乏对模型内部工作机制的深层因果理解,导致其提出的改进方案往往停留在理论层面,缺乏可操作性和可验证性。
值得注意的是,AI4AI-Bench的测试任务设计刻意避免了让模型直接编写代码或修改参数,而是要求模型以自然语言形式描述改进思路。这一设计旨在排除模型对训练数据中已有代码片段的记忆性复现,从而更真实地评估模型的推理和创新能力。
EinsiaAI是一家专注于AI基础设施评估的初创公司,此前曾发布过针对AI编程助手和AI Agent的工具链评测产品。该公司表示,AI4AI-Bench的推出填补了AI自我改进能力评估领域的空白,为研究人员和开发者提供了一个标准化的衡量工具。
行业分析人士认为,AI4AI-Bench的测试结果从侧面反映出一个重要事实:尽管大模型在语言理解、代码生成和图像识别等任务上取得了显著进展,但距离实现真正的自主迭代和进化仍有相当距离。当前AI系统的能力本质上仍是对人类知识和模式的统计性复现,而非对自身运行原理的深刻理解。
该基准测试的发布也引发了关于AI发展路径的讨论。部分研究者认为,AI自我改进能力的提升将加速技术进步,但也带来了安全性和可控性方面的隐忧;另一些研究者则认为,当前的技术路线决定了AI难以在短期内实现真正的自我改进,相关担忧为时过早。
EinsiaAI方面表示,AI4AI-Bench将保持定期更新,随着大模型能力的迭代持续补充新的测试任务和评估维度。该公司计划在下一次更新中引入更多针对模型架构搜索和超参数优化的测试场景,以更全面地覆盖AI自我改进的不同技术路径。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。