ElevenLabs发布v4与v4 Turbo语音模型,支持90余种语言、10秒音频完成声音克隆

新版本的语言支持数量提升至90种,官方称日语、巴西葡萄牙语、普通话以及粤语的合成质量提升最为显著。

ElevenLabs于当地时间周一正式发布两款全新语音模型ElevenLabs v4与v4 Turbo。新模型在情绪表达控制、语音智能体响应延迟以及多语言支持方面均有明显升级,语言覆盖数量从旧版的70种提升至90余种,用户仅需10秒音频素材即可完成声音克隆。

据官方介绍,v4系列采用全新架构,实现了更精细的语音控制与速度更快的声音克隆。在内容创作场景中,当模型朗读大段文本时,能够更好地维持说话人的音色特征,并在朗读过程中结合前后文本语境动态调整语气。ElevenLabs在v3版本中首次引入内联标签用于设定语音情绪,v4对这一功能进行了扩充,支持用户叠加多个标签,模型将按照标签的先后顺序依次执行。

多语言能力是此次升级的重点之一。旧版模型支持70种语言,经过优化后,新版本语言支持数量提升至90种。ElevenLabs表示,日语、巴西葡萄牙语、普通话以及粤语的合成质量提升最为显著。该公司去年发布v3模型,并于今年早些时候在华沙举办的活动上对新一代模型进行了预热。

在语音智能体场景中,v4的低延迟特性可带来更流畅的对话体验。官方指出,当后端大语言模型刚开始输出回答时,v4即可同步生成语音音频,从而缩短整体响应时间。此外,该模型能够差异化处理争执对话、诉求升级以及通话等待等场景,以更好地适配企业级业务需求。

企业业务已成为ElevenLabs收入结构中的主导部分。过去一年,该公司的企业语音通话业务扩张迅速,目前超过55%的业务收入来自大型企业。财务数据方面,ElevenLabs的年化营收运行速率已从年初约3.3亿美元攀升至6亿美元以上。今年早些时候,该公司从红杉资本获得5亿美元融资,投后估值达到110亿美元。目前已有传闻称其正在筹备新一轮融资,目标估值或达220亿美元。

人员与市场布局方面,ElevenLabs正在印度、欧洲、巴西等多个市场大举招聘,员工总人数已突破800人。联合创始人兼首席执行官马蒂·斯坦尼舍夫斯基在近期接受TechCrunch采访时表示,公司计划在未来几年内完成IPO上市,但未给出确切时间节点。

从行业视角看,语音合成赛道正从单纯的音质竞争转向延迟、情绪控制与多语言覆盖等综合能力的比拼。ElevenLabs此次将语音克隆门槛降至10秒音频,同时强化与大语言模型的协同能力,意味着语音智能体在客服、外呼等企业场景中的落地条件进一步成熟。随着企业收入占比过半、IPO计划提上日程,该公司能否在竞争加剧的语音AI市场中维持增速,将取决于其模型迭代节奏与企业客户留存能力。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
OpenAI上线对齐失效报告网站,披露九起智能体失控事件
上一篇 1小时前
消息称 2026 年京东 11.11 双十一活动 10 月 12 日开启,新增“超级服务日”
下一篇 4天前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部