谷歌发布 Gemini 3.8 Flash 系列文本转语音模型,支持逐行台词控制与 2000 种现成语音

两款新模型分别为 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,定位各有不同。

谷歌宣布推出两款全新文本转语音模型 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,将语音生成能力从静态预设扩展为可动态定制的创作工具,面向创作者、开发者及企业用户。两款模型已在 Gemini API 和 Google AI Studio 中向开发者推送,企业用户后续可通过 Gemini Enterprise 中的 API 调用。

Gemini 3.8 Flash TTS 面向深度创意方向和角色设计,支持通过自然语言提示从头创建全新语音,并可对表演提示、节奏、方言转换等进行精细控制,适用于游戏、有声读物、播客和互动媒体场景。Gemini 3.8 Flash-Lite TTS 则针对大容量、高性价比的规模化场景优化,主要覆盖大容量配音、音频内容创作和语音代理等用途。

功能层面,两款模型支持生成式语音设计,可在 100 多种语言和方言中自定义角色、口音与语音特征;语音库从原有 30 种原始语音扩展至 2000 多种现成语音,覆盖墨西哥西班牙语、魁北克法语、苏格兰英语等区域变体。语音复制功能仅需 30 秒音频样本即可重现一致的声音特征,并内置同意验证、SynthID 水印和 C2PA 凭据。此外,模型支持自定义语音的保存与管理,以减少持续项目中的性能漂移。语音混音功能即将推出,用户可对音色、音高、节奏和口音进行微调。

在台词控制方面,两款模型允许用户编写舞台指导或通过脚本提示引导交付,实现逐行表演控制。模型支持数小时连续音频的长篇生成,保持语音质量、自然节奏和角色音色的一致性。原生双声音场景编排可从单个脚本中指导多轮对话,保持两种声音清晰分离。用户还可添加非语言提示(如 <laughs>、<sigh>、<gasp>)和主动倾听插入语,用于精确控制喜剧时机和反应节奏。

性能数据方面,Gemini 3.8 Flash TTS 在 Hume AI 语音设计基准测试中以 71.4 分位居总体第一,口音建模得分 60.8 分同样领先。两款模型在 Hume AI 整体质量指数中分列第一和第二。在 Voice Arena 的盲法人类偏好评估中,两款模型在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语等主要语言中处于领先位置。

谷歌在语音创建和复制功能中内置了保护措施。语音复制要求用户提供来自语音所有者的口头同意记录,与参考说话者匹配后方可创建。所有生成的音频片段均带有难以察觉的 SynthID 水印,用于检测 AI 生成语音。通过 AI Studio 进行的语音复制在伊利诺伊州、德克萨斯州、欧洲经济区、英国、瑞士和印度不可用。面向所有用户,Gemini 3.8 Flash TTS 已在 Gemini Notebook 中上线,Gemini 3.8 Flash-Lite TTS 已在 Google Vids 中上线。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
罗福莉宣布小米MiMo-V3将采用全新架构,核心组件HySparse 2正式发布
上一篇 1小时前
前程无忧私有化,可能代表人力资源行业的底层逻辑重塑
下一篇 2021年5月13日 上午11:00

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部