B站上线AI无限竞技场大模型测评榜,GPT-6 Astra首轮居首

不同于传统跑分评测,B站 AI 无限竞技场不设主题或测评维度限制,来自各个分区的 UP 主们以真实工作流、专业应用、趣味脑洞等自主命题,在同题 PK 中直观呈现各模型的实际表现差异。

9月20日,B站宣布上线“AI无限竞技场”大模型测评榜,并同步公布首轮模型排行榜。榜单显示,GPT-6 Astra在10位UP主的测评中拿下榜首,成为获得榜首次数最多的模型,GLM-5.3位列其后。前五名中,国产大模型占据三席。

据B站介绍,“AI无限竞技场”是一个汇集B站UP主AI大模型测评内容的竞技平台,由各领域UP主对上百个大模型的真实场景实测构成,涵盖代码、推理、协作、知识等多种测评主题。与传统跑分评测不同,该竞技场不设主题或测评维度限制,UP主以真实工作流、专业应用、趣味脑洞等自主命题,在同题PK中呈现各模型的实际表现差异。

榜单覆盖DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、Hy、MiniMax等主流模型的对比测评,排名实时更新,并持续面向全站UP主开放报名。用户可通过B站官方页面查看完整榜单及测评内容。

B站方面披露的数据显示,过去一年平台AI知识内容消费时长同比增长72%,月均观看AI内容的用户超过1.9亿。平台已涌现出大量覆盖不同领域、维度和主题的测评内容,形成从模型发布到用户讨论、测评、使用、求助、共建的完整内容生态。

此次上线测评榜,意味着B站正试图将其社区内分散的AI测评内容进行结构化整合,以UP主实测替代传统基准测试,为开发者与用户提供另一种观察大模型实际能力的参考维度。在模型迭代加速、跑分与实际体验差距频受讨论的背景下,这类基于真实工作流的众测榜单能否形成持续公信力,仍有待观察。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
力箭一号完成第16次飞行 一箭9星验证商业航天拼箭模式
上一篇 3小时前
中国互联网大厂竞逐AI办公智能体,协同办公入口成新战场
下一篇 3小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部