阿里千问发布 Qwen-Audio-3.1 系列语音大模型,全线产品价格下调最高达 95%

五款全新的语音模型同时推出,形成了一套覆盖“理解-生成-交互-创作”的完整音频能力栈。

9 月 23 日,阿里千问正式发布 Qwen-Audio-3.1 系列语音大模型,对语音识别、语音合成和实时语音交互三大核心模型进行全面升级,同时推出音频创作模型 Qwen-Audio-3.1-TTS-Next 和音频理解模型 Qwen-Audio-3.1-ASR-Next。五款模型共同构成覆盖“理解-生成-交互-创作”的完整音频能力栈。伴随此次发布,千问对 Qwen-Audio 全线语音模型进行价格下调,其中 TTS 降价约 70%,Realtime 降幅约 85%,ASR 降幅达 95%。

在语音识别方面,Qwen-Audio-3.1-ASR 是新一代语音识别大模型,进一步增强多语种、方言识别与上下文理解能力,并新增原生转写润色能力,可自动去除语气词与重复表达并重组语义。该模型支持 30 种语言和 16 种中文方言,具备低延迟流式识别能力,首字响应约 160 毫秒。在公开方言测试集上,该模型平均 CER 为 4.55%,在 6 个子集上取得最优结果;在中文方言内部自建测试集中,11 个方言子集取得最优,平均 CER 为 10.38%,方言转普通话的平均语义句准率达到 82.10%。

全新发布的 Qwen-Audio-3.1-ASR-Next 基于下代架构,能够理解人物情绪、环境声与机械声,完成声音描述、事件定位、音频问答与推理。该模型的处理对象从“语音中的文字”扩展为“完整的音频信息”,可对同时包含对话、背景音乐和环境声的音频输出对话文本,并进一步描述声音类型与事件发生时间。在分角色 ASR 评测中,Qwen-Audio-3.1-ASR-Flash-Next 和 Qwen-Audio-3.1-ASR-Flash 在四个测试集的八项指标中分别取得五项和三项最优结果。

语音合成方面,Qwen-Audio-3.1-TTS 支持多语种及方言合成,并支持同一音色跨语言合成时的自然迁移。该模型通过指令控制情绪、语速和表达方式,使声音表达贴近具体内容与使用场景。新推出的 Qwen-Audio-3.1-TTS-Next 则面向完整音频创作,不再局限于单一语音合成,而是围绕文本、时间戳和参考音频等输入,统一生成人声、音效和环境音。该模型支持多人音色复刻与多轮对话生成,在连续内容中保持各角色音色特征一致,并支持细粒度时间戳控制、声音复刻和 48kHz 输出,可满足播客、有声书、影视剧、游戏、广告等专业音频创作需求。

实时语音交互模型 Qwen-Audio-3.1-Realtime 此次升级聚焦全双工交互能力,支持同时说和听,用户可随时插话、打断。模型在识别文字之外,还可理解声音背后的情绪与交流意图,并根据上下文调整语速和措辞。该模型支持多语言实时交流与自然切换,对话中切换语言时保持此前的上下文、语气和交流节奏。此外,模型强化了安全边界与事实可靠性,在面对不确定信息时减少缺乏事实依据的回答。当需求涉及外部信息或业务系统时,模型可在对话中调用工具,连接 API、知识库和业务系统完成搜索、查询或任务执行,并将结果自然带回对话。

从行业视角看,此次发布呈现出两个明确方向。其一,语音模型的能力边界正从单一的识别或合成,向覆盖理解、生成、交互与创作的全链路延伸,ASR 的处理对象从文字扩展至完整音频信息,TTS 则从语音合成扩展至包含人声、音效与环境声的完整音频内容生成。其二,价格大幅下调表明语音大模型的调用成本正在快速下降,其中 ASR 降幅达 95%,这将在一定程度上降低企业接入语音能力的门槛,推动语音技术在会议记录、客服系统、内容创作等场景中的规模化应用。

随着语音模型在方言识别、情绪理解和实时交互等维度持续迭代,其在企业服务领域的落地空间值得关注,尤其是在智能客服、会议转写、多语言协作等场景中,模型能力的提升与调用成本的下降可能加速相关应用的普及。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
zeb与Cognition达成合作,将自主AI软件工程师Devin引入全球企业
上一篇 2小时前
Meta为AI助手Muse测试人工代打电话引发内部隐私争议
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部