年经常性收入约1亿美元的电商AI客服平台Gorgias近日发布了一份公开基准评测,将其自有AI智能体与主要竞争对手进行横向对比。该评测基于8356组真实对话、覆盖18家厂商和212个以上线上店铺,测试框架已在GitHub上开源,并计划每周刷新。
Gorgias约80%的收入来自面向电商品牌的AI客服业务。此次评测采用统一的10轮对话脚本,对每一家参与厂商运行相同的测试流程。与常见的分析师象限图、功能清单或厂商自吹的“快3倍”幻灯片不同,这份评测直接跑在真实产品上,点名竞争对手,并公开了自身落败的类别。
评测结果并未全部有利于Gorgias。在支持场景中,Gorgias综合质量排名第一,但Yuma解决了更多对话。自动化率是支持类买家最看重的指标,而在这项指标上,领先者是竞争对手,且这一结果就发布在Gorgias自己的页面上。在售前场景中,Envive目前以72比65的综合得分领先Gorgias。Gorgias在回答质量上得分最高(76分),但平均每条回答耗时18.4秒,而Envive仅需7.9秒。报告自身的延迟分析显示,Gorgias有28%的购物类回答耗时超过20秒。
值得注意的是,Gorgias选择了对自己不利的权重设置。售前综合评分中速度占25%,而支持综合评分中速度仅占10%。如果按支持场景的权重来给售前评分,Gorgias将以74.3分位居第一。Gorgias解释称,之所以采用更严格的权重,是因为购物者在回答过慢时会离开。
当前,B2B领域每一家AI厂商都宣称自己最好,但愿意展示数据的少之又少。大语言模型的评测已较为常见,但针对AI智能体的详细评测仍然稀缺。买家如今可以在一个下午内并排测试多个AI智能体,智能体本身也开始参与供应商初筛,甚至在某些情况下直接做出采购决策。在这一背景下,发布深度、直接的竞品评测正在成为AI厂商建立信任的一种方式。评测难免存在偏差——评分标准、权重和测量维度均由厂商自行设定——但关键在于将这些设定公开在首页,并确保所有结果可验证。
Gorgias此次开源的测试框架和每周刷新的机制,为AI客服领域的竞争透明度提供了一个可参照的样本。随着AI智能体在采购决策中扮演越来越重要的角色,厂商主动公开竞品评测数据可能从差异化优势转变为行业基本要求。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。