Rippling公布15款AI模型真实薪资数据处理测试结果:最便宜模型与最贵模型准确率持平

质量在顶部趋于平坦,价格却没有。

Rippling总裁兼首席产品官Matt MacInnis近日公布了一项罕见的AI模型实测结果:在真实生产环境中,对15款AI模型进行约2,100次评分测试,覆盖实际人事、薪资和财务数据。这项测试并非行业常见的排行榜或虚构任务,而是让模型在真实业务场景中完成具体操作,包括按部门统计人数、计算任职年限分布、执行批量调薪、完成新员工入职流程、安排解聘并流转审批、从电子表格录入付款金额等。

测试标准极为严格:每次尝试要么通过Rippling生产系统的正确性检查,要么失败,未完成即视为失败。这一评分标准比大多数公开基准测试更为严苛。研究围绕三个核心指标展开:通过率(模型正确完成任务的频率,无部分得分)、成本(完整运行全套测试的美元费用)以及最慢10%用时(反映体验最差情况下的任务耗时,而非平均值)。

测试结果显示,15款模型实际上可归结为三个选择。Anthropic的Opus 4.6以91.0%的通过率位居榜首,成本1,453美元,最慢10%用时154秒。紧随其后的OpenAI GPT-5.5 med获得89.5%通过率,成本1,435美元——两者成本仅差18美元,准确率差距1.5个百分点,在测试误差范围内。MacInnis估计Rippling为适配Opus 4.6花费的五个月调优可贡献1至2个百分点的提升,因此两者实际旗鼓相当,真正区分它们的是速度,Opus 4.6更快。

GPT-5.5 low版本以88.8%通过率、1,308美元成本和130秒最慢用时成为速度优先的选择,比Opus 4.6便宜且更快,但准确率低2.2个百分点。值得注意的是,OpenAI同一模型的两个不同配置分别排在Opus 4.6两侧,说明模型设置比品牌更重要。智谱GLM 5.2以88.7%通过率、621美元成本和243秒最慢用时成为成本最优选项,准确率与GPT-5.5 low相差不到0.1个百分点,价格却只有一半,速度则慢得多。所有夜间任务、数据回填和数据增强运行都适合使用这类模型,而昂贵模型不在其列。

研究还揭示了一些性价比极低的组合:Fable 5以3.3倍价格和两倍等待时间才达到GPT-5.5 low的准确率;Opus 5在价格和速度上均被Grok 4.5击败,后者得分仅低0.2个百分点,成本却低68%。MacInnis为B2B创始人总结了七条启示,其中最核心的一点是:质量在顶部趋于平坦,价格却没有。七款模型通过率集中在88.5%至89.5%之间,仅一个百分点的差距,而成本差异却高达数倍。

这一测试为B2B企业选择AI模型提供了难得的真实数据参考。在模型能力普遍接近的当下,成本与响应速度正成为关键决策变量,企业应根据具体业务场景对准确率、预算和延迟的优先级做出选择,而非盲目追求最贵或最新的模型。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
Warp发布Warp Factories系统,简化AI软件开发基础设施搭建
上一篇 2小时前
微软为Windows右键菜单引入自定义功能 用户可移除不需要的选项
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部