9月28日,在全球权威AI评测平台Artificial Analysis的语音排行榜(Controlled Voice Arena)上,阿里巴巴近期发布的语音大模型Qwen-Audio-3.1-TTS以1177的Elo评分位列全球第一。该榜单采用受控对比评测机制,通过大量人工盲测对模型生成的语音进行两两比较,最终以Elo评分体系量化排名,在语音合成领域具有较高的参考价值。
Qwen-Audio-3.1-TTS是阿里新一代语音合成大模型,支持多语种及方言合成。该模型的核心能力在于能够让同一音色在不同语言之间自然迁移,即用一种声音自然讲出多种语言,从而在跨语言场景中保持音色的一致性与辨识度。相比传统语音合成主要关注字音是否正确,Qwen-Audio-3.1-TTS更强调声音是否符合具体内容和使用场景。用户可通过指令控制情绪、语速和表达方式,使合成语音在准确度之外具备更强的表现力与场景适配能力。
此次登顶的模型属于阿里在2026云栖大会发布的Qwen-Audio-3.1系列。该系列除TTS(语音合成)外,还包括语音转写(ASR)和实时语音交互(Realtime)两类模型,覆盖从语音识别到语音生成再到实时对话的完整链路。目前,三大模型的API服务均已上架千问AI平台,开发者与企业可直接调用。
在开源生态方面,阿里语音团队此前开源的多款模型已积累较高关注度。其中Qwen-Audio-Agent、CosyVoice等项目在GitHub上累计获得数万星标,受到海内外开发者持续关注。开源与API服务并行的策略,使阿里语音模型在学术研究、产品原型开发与商业化部署等不同层面均具备可接入路径。
价格方面,Qwen-Audio全线语音模型均已下调,最高降幅达95%。这一调整显著降低了开发者和企业在语音合成、语音识别及实时交互等场景中的调用成本,有助于推动语音能力在客服、教育、内容生产、智能硬件等领域的规模化应用。
从行业视角看,语音合成赛道近年来竞争焦点正从“可懂度”向“自然度”与“可控性”迁移。随着大模型技术引入,语音合成在情感表达、多语种迁移、指令遵循等维度的能力边界持续扩展。阿里此次在第三方评测中登顶,叠加全线降价与开源布局,或将进一步加剧语音AI市场的竞争,并加速语音能力在企业服务场景中的渗透。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。