9月15日,谷歌 DeepMind 在官方博客发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款音频到音频(audio-to-audio)实时对话模型,同步上线 Gemini API 与 Search Live。
据谷歌披露,Extended Thinking 版本在 Artificial Analysis 语音质量指数上以 82.6 分登顶,τ-Voice 得分 68.6%。与“先转文字再生成语音”的级联方案不同,音频到音频架构在同一空间内完成理解与生成,省掉中间转写环节,因此能保留语气、停顿与情绪线索,端到端延迟也更低。
这意味着语音交互的竞争焦点从“识别准不准”转向“对话像不像人”。对客服、外呼、车载与会议记录类企业场景,“实时语音+思考”的组合会直接改写产品体验与单位成本;而 Search Live 的接入说明,谷歌正把语音当作搜索的新入口,而不只是辅助功能。(来源:Google 官方博客 The Keyword)
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。