企业服务领域一项新的公开基准测试显示,AI客服智能体在真实电商场景中的问题解决能力存在显著分化。电商AI客户体验平台Gorgias(年经常性收入1亿美元)发布了针对13家厂商的基准测试结果,测试覆盖212家真实运营的中型电商店铺,不设沙盒环境、不使用合成商品目录或厂商演示数据。所有智能体接收相同的客户消息,由评审系统在不知晓厂商身份的情况下,依据26项二元检查对每条回复进行评分。价格、政策、SKU等事实性声明会与实时店铺数据进行程序化核验。
测试结果显示,表现最佳的AI智能体能够完全解决约70%的对话,而典型厂商的解决率不足一半。排名前五的厂商解决率在64%至75%之间,中位数厂商的解决率为48%。按对话量加权计算,整个行业的平均自动化解决率为46%。自动化率在此定义为AI在无人工介入情况下解决的已参与对话占比。
具体排名方面:Rep AI以75%的自动化率(120次对话)居首,Decagon为73%(34次),Yuma为71%(118次),Ada为68%(420次),Gorgias为64%(388次)。DigitalGenius为50%(561次),Sierra为48%(408次),Siena为46%(300次),Kodif为44%(188次),Intercom为42%(307次),Zendesk为37%(467次),Envive为22%(499次),Klaviyo为21%(309次)。
基准测试同时揭示了自动化率与回答质量之间的错位。Yuma、Decagon和Gorgias是唯一在自动化率超过64%的同时质量评分超过65的厂商。Yuma自动化率71%、质量评分72;Decagon自动化率73%、质量评分70;Gorgias自动化率64%、质量评分66。Rep AI自动化率75%但质量评分仅55,Ada自动化率68%但质量评分仅39。Sierra质量评分72与Yuma并列最高,但自动化率仅48%。
测试报告指出,仅关注自动化率可能指向错误的厂商选择。一个被标记为已解决但给出错误退货窗口的工单,会引发二次联系,其成本高于首次接触。质量评分为39的厂商实际上在制造未来的工单量。
值得注意的是,Zendesk、Intercom和Klaviyo是多数品牌已付费使用的平台,但在此次基准测试中,三者解决率均未超过42%。数据显示,现有帮助台或邮件工具内置的AI功能是当前可选方案中表现最弱的一类。
趋势数据同样不容乐观。在拥有足够历史数据的10家厂商中,9家的自动化率在过去四周出现下滑:Siena下降23个百分点,Kodif下降13个百分点,Klaviyo下降11个百分点,Sierra下降11个百分点,DigitalGenius下降10个百分点,Ada下降9个百分点,Gorgias下降6个百分点,Intercom下降6个百分点,Zendesk下降4个百分点。仅Envive一家实现增长,提升8个百分点。质量评分走势相同,10家中有9家下降,其中Ada下降17个百分点,Zendesk亦出现下滑。
该基准测试为AI客服领域提供了一个少见的真实场景参照。对于正在评估AI客服方案的企业而言,自动化率与回答质量需同时纳入考量,而现有平台内置的AI能力在短期内可能难以满足实际业务需求。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。