企业级语音AI公司Guava于近日发布新一代语音模型Daytona,同时推出面向语音智能体质量评估的开放评分框架Guava Voice Index(GVI)。Guava一并公布了Daytona与另外三款主流语音AI系统、以及处理相同通话任务的真人客服的对比测试结果。
Guava联合创始人兼首席执行官Omri Dahan表示,几乎每一家语音AI公司都会宣称自己的智能体听起来像真人,但很少有公司会说明它是否真正完成了通话任务。Dahan称,Guava以采购方的视角构建了这一评测体系,并公开了自身产品的得分,包括那些仍需改进的指标。
Guava Voice Index从响应速度、对话流畅度、语音保真度、问题解决能力和TTS质量五个维度对语音智能体进行0至100分的评分。其中内容准确性占60%权重,语音体验占40%。自动化评测层参考了ServiceNow发布的语音智能体评测套件EVA-Bench的部分组件,以及基于Coval语音AI基准测试测得的词错误率。人工评测层则采用盲测成对比较方式,由外部评审小组执行,每组配对至少配备十名评审员。所有系统均与处理相同通话任务的真人客服进行对比,评测方式涵盖音频听测与转录文本审查。Guava已在goguava.ai/gvi公开完整方法论、各维度权重及验证门槛,供外界审查评分过程。
Guava联合创始人兼工程负责人Anthony Scodary表示,多数语音基准测试范围非常狭窄,仅针对语音转文字、文字转语音或极短的示例对话。GVI基于真实对话,并混合了机器与人工评审,他认为这将成为新的黄金标准。
2026年9月参与测试的四套系统分别为Guava Daytona、ElevenLabs搭配GPT 5.4、Grok,以及ElevenLabs搭配Haiku 4.5。Daytona以58.88分位居第一,领先ElevenLabs搭配GPT 5.4的57.11分、Grok的53.60分以及ElevenLabs搭配Haiku 4.5的51.06分。没有任何系统得分超过60分。Daytona在保真度、人工评审的语音质量和响应时间方面领先,但并非在所有维度均占优:ElevenLabs搭配GPT 5.4在问题解决能力上得分更高,获得可用分数的79%,而Daytona为67%。两项结果均已公开。
所有系统同时与处理相同通话任务的真人客服进行了对比。在全部四套系统的测试中,评审员在响应时机维度上有91%的对比中更偏好真人客服,在打断恢复维度上这一比例为93%,Daytona亦不例外。
Guava从语音识别到语音合成全部模型均由公司自行构建和运营。自2013年以来,Guava的模型基于超过100亿分钟的真人客服通话数据训练,并已在100多个生产环境中部署。该公司已通过SOC 2合规认证。
此次发布的评测框架将语音智能体的评估标准从单一的音质对比扩展至任务完成能力与真实对话表现,对于企业选型语音AI产品具有参考意义。Daytona的得分虽然领先,但整体得分偏低以及真人客服在关键交互维度上的明显优势,也反映出当前语音智能体在响应时机与打断处理等环节仍有较大提升空间。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。