AI模型评测平台Arena完成2亿美元B轮融资,估值升至31亿美元

AI的发展速度已经超过了我们的评估能力。模型一旦发现自己在接受测试,固定的基准测试就会失效。

AI模型评测平台Arena宣布完成2亿美元B轮融资,投后估值达到31亿美元。此时距离其上一轮融资仅过去约10个月,估值接近翻倍。本轮融资由光速创投和Khosla Ventures共同领投,Salesforce Ventures、01 Advisors、戴尔科技资本、Endeavor Catalyst、a16z、Felicis等机构参与投资。

Arena最初是加州大学伯克利分校于2023年发起的一项研究项目,通过公众投票的方式对AI模型进行排名。用户可以在平台上输入提示词,或要求AI按照指定要求编写程序、开发项目,随后比较不同模型的完成效果并进行评分。该评测平台对个人用户免费开放,目前每月吸引数千万名访客。

商业化方面,Arena于去年9月推出面向AI模型研发机构和企业的商业服务AI Evaluations,利用社区用户的反馈数据,提供详细的模型性能分析。今年6月,Arena披露其年化营收达到1亿美元。而在今年1月完成1.5亿美元A轮融资时,其投后估值为17亿美元,当时的年化营收为3000万美元。从3000万美元到1亿美元的年化营收增长,与估值从17亿美元到31亿美元的跃升基本同步。

Arena此轮融资的背景是,AI模型评测领域正在经历一轮信任危机。今年,AI研发机构发现,旗下模型能够通过迎合基准测试的规则获得高分,却未必具备相应的实际能力。与此同时,企业客户也不再满足于标准化测试成绩,而是希望了解哪款模型更适合自己的具体业务需求。固定基准测试的失效,使得独立第三方评测的价值被重新审视。

Arena在融资公告中指出:“AI的发展速度已经超过了我们的评估能力。模型一旦发现自己在接受测试,固定的基准测试就会失效。世界需要一个中立的第三方,检验AI在实际使用中是否安全、行为是否符合人类的预期。Arena开始承担这一角色。”

为此,Arena在排行榜中新增了对齐能力评测,重点考察三类行为:模型是否会擅自执行用户没有要求的操作;是否会张冠李戴,将言论或事实归于错误的来源;以及是否会谎称完成了任务。Arena将最后一种行为称为“欺骗性完成”。在初步公布的对齐能力排行榜上,OpenAI多款模型名列前茅,Claude Opus 5.5排名第六,Claude Fable排名第九。

从行业视角看,Arena的融资节奏和估值变化反映了AI基础设施层的一个趋势:随着模型能力快速迭代,评测环节正在从学术研究项目演变为独立的商业赛道。模型研发机构需要第三方数据来验证模型的实际表现,企业客户需要中立参考来辅助选型决策,而监管层面对于AI行为安全性的关注也在上升。Arena试图在这三方需求之间建立一套基于社区反馈的评测标准。

不过,评测平台的商业模式能否持续支撑其估值,仍取决于两个因素:一是社区投票数据能否在模型规模持续扩大、评测需求日益专业化的背景下保持代表性和公正性;二是企业客户是否愿意为定制化的模型评估服务持续付费。Arena目前尚未披露AI Evaluations业务在总营收中的占比,其收入结构仍以平台流量和商业评测服务为主。

本轮融资完成后,Arena计划进一步扩展对齐能力评测的覆盖范围,并深化面向企业客户的模型选型分析服务。在AI模型能力趋同、企业部署需求分化的阶段,独立评测平台的角色将变得更为关键。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
深圳DiffuSpace5亿元融资刷新全球扩散语言模型融资纪录,华为、地平线押注其中
上一篇 3小时前
鲲为科技完成4亿元新融资,以低频超声与AI算法切入脑科学基础设施赛道
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部