谷歌DeepMind发布Gemini 3.8 Live语音模型 语音质量指数82.6分登顶

音频到音频一步到位,语音交互的竞争从识别率转向拟人度。

9月15日,谷歌 DeepMind 在官方博客发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款音频到音频(audio-to-audio)实时对话模型,同步上线 Gemini API 与 Search Live。

据谷歌披露,Extended Thinking 版本在 Artificial Analysis 语音质量指数上以 82.6 分登顶,τ-Voice 得分 68.6%。与“先转文字再生成语音”的级联方案不同,音频到音频架构在同一空间内完成理解与生成,省掉中间转写环节,因此能保留语气、停顿与情绪线索,端到端延迟也更低。

这意味着语音交互的竞争焦点从“识别准不准”转向“对话像不像人”。对客服、外呼、车载与会议记录类企业场景,“实时语音+思考”的组合会直接改写产品体验与单位成本;而 Search Live 的接入说明,谷歌正把语音当作搜索的新入口,而不只是辅助功能。(来源:Google 官方博客 The Keyword)

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
飞书开放CLI接口并推出团队Agent,办公协同平台竞逐智能体执行层
上一篇 2小时前
IBM调研:大型企业AI平均ROI仅17% 云成本超预算近50%
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部