ElevenLabs发布v4语音模型,支持90种语言与更精细的表达控制

该模型支持90种语言,并允许用户通过标签对语音表达进行更精细的控制,例如指定耳语、笑声或兴奋的语气。

语音人工智能公司ElevenLabs近日推出其最新语音合成模型v4,该模型支持90种语言,并新增了对语音表达方式的精细化控制能力。用户可以通过标签指定耳语、笑声或兴奋等语气,从而生成更具表现力的语音内容。

据ElevenLabs介绍,v4模型仅需10秒的音频片段即可完成声音克隆,进一步降低了语音定制的门槛。这一能力对于需要快速生成多语言语音内容的企业客户而言,意味着更短的制作周期和更低的成本。

ElevenLabs成立于2022年,专注于生成式语音技术,其产品广泛应用于有声书制作、视频配音、客服系统以及无障碍阅读等场景。此前该公司已推出多个版本的语音合成模型,并逐步扩展对多语言和情感表达的支持。v4的发布标志着其在语音自然度和可控性方面又迈出一步。

在AI语音赛道竞争日益激烈的背景下,ElevenLabs面临来自OpenAI、谷歌以及多家初创公司的竞争。对表达细节的控制和更广泛的语言覆盖,正成为语音合成服务商差异化竞争的关键。企业客户在选择语音API时,除了音质和延迟,也越来越关注能否通过参数调整来匹配特定品牌调性或内容风格。

目前,ElevenLabs尚未披露v4模型的具体定价和API开放时间。随着多语言语音交互在客服、教育、媒体等企业服务场景中的渗透,此类模型的迭代将直接影响相关应用的落地效率和用户体验。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
谷歌前CEO施密特斯坦福分享:AI成本高企致开源难以为继,Mistral将转闭源
上一篇 1小时前
支付宝推出AI钱包智能体,AI支付从可支付迈向可信支
下一篇 2026年9月11日 下午1:46

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部