阿里千问发布同声传译大模型Qwen3.8-LiveTranslate,字均延迟降至2.3秒

在覆盖14个语向的多说话人长音频评测集Omnilingua-MSpeaker上,Qwen3.8-LiveTranslate在翻译的忠实度、流畅度、简洁度以及说话人识别的错误率DER四个维度上均优于目前行业主流实时同传系统。

9月19日,阿里千问正式发布同声传译大模型Qwen3.8-LiveTranslate。该模型以Interleave架构重构实时同传流程,在准确度、流畅度和简洁度三个维度上实现全面提升,字均延迟(LAAL)从上一代的2.8秒降至2.3秒。

Qwen3.8-LiveTranslate在原有60种语言支持的基础上,新增三项面向真实场景的能力。第一,实时说话人分离,确保每句话的归属清晰可辨,同时提升音色复刻的稳定性;第二,原文与译文同帧同出,实现双语同屏显示;第三,长上下文消歧,模型能够联系前文语境理解当前内容,在人名和术语的翻译上更加精准。

在模型架构层面,Qwen3.8-LiveTranslate采用基于Hybrid MoE的Thinker–Talker双模块设计,通过Interleave方式衔接流式理解、文本输出与语音生成。具体而言,Thinker模块将视频、音频、原文与译文编排进同一条因果序列,按时序交替排列、端到端产出,使理解与翻译在单一序列内完成;Talker模块则结合译文和源音频,将译文合成为保留原说话人音色的译文语音。这一架构设计的核心思路在于,将传统同传系统中分离的语音识别、机器翻译和语音合成三个环节整合到统一的序列建模框架中,从而减少模块间信息传递造成的延迟和语义损失。

在评测方面,官方在覆盖14个语向的多说话人长音频评测集Omnilingua-MSpeaker上进行了测试。结果显示,Qwen3.8-LiveTranslate在翻译忠实度、流畅度、简洁度以及说话人分离错误率DER四个维度上均优于目前行业主流的实时同传系统。此外,官方在公开FLEURS音频测试集上评测了70个语言方向的实时同传表现,Qwen3.8-LiveTranslate在翻译质量、字均延迟、语音识别准确率以及语音合成质量四个维度上均领先于上一代模型及当前主流实时同传系统。

实时同声传译一直是AI语音领域技术难度最高的方向之一。传统方案通常采用级联架构,即先由语音识别模块将音频转为文本,再通过机器翻译模块完成语言转换,最后由语音合成模块输出译文语音。这种流水线式的处理方式不仅会累积各环节的延迟,还容易在模块交接处丢失副语言信息,例如说话人音色、情感语调和停顿节奏。近年来,业界开始探索端到端的同传方案,试图在单一模型内完成从源语言语音到目标语言语音的直接转换,但在翻译质量、延迟控制和说话人一致性方面仍面临诸多挑战。

Qwen3.8-LiveTranslate的发布,反映出阿里千问在多模态大模型方向上的持续投入。从技术路线来看,该模型将同传任务纳入统一的序列建模框架,并引入Hybrid MoE架构以平衡推理效率与模型容量,这与当前大模型领域向多模态融合、端到端优化演进的趋势一致。字均延迟从2.8秒降至2.3秒,虽然绝对值变化不大,但在同传场景中,每一秒的延迟降低都直接影响用户体验,尤其是在会议、直播等对实时性要求较高的场景中。

目前,该模型已开放尝鲜体验入口,并同步上线模型API。从商业化路径来看,实时同传能力的API化输出,意味着该技术可被集成至视频会议、在线教育、跨境直播、客服系统等企业级场景中。对于企业服务领域而言,低延迟、高保真的同传能力有望进一步降低跨语言沟通的门槛,推动全球化协作工具的能力升级。阿里千问方面暂未披露该模型的定价方案和具体的企业级部署计划。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
OpenAI开放ChatGPT for Word,免费用户可在Word侧边栏调用AI起草与校对
上一篇 2小时前
Meta CTO回应智能眼镜隐私争议:少数恶意用户不应主导公众讨论
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部