谷歌发布Gemini 3.5 Transcribe语音转文本模型,自动清理口头禅并提升转录速度

谷歌表示,与此前名为Chirp 3的语音转文字引擎相比,Gemini 3.5 Transcribe在速度和准确性方面都有提升。

8月27日,谷歌发布了Gemini 3.5系列中的新款语音转文本模型Gemini 3.5 Transcribe。该模型旨在优化语音输入体验,能够自动删除语音中的“嗯”“呃”等口头禅,并实时调整说错后自行纠正的内容,最终生成更通顺、整洁的文本。目前,该模型已为Pixel 11上Gboard键盘的“Rambler”功能提供支持,后续将逐步集成至谷歌旗下更多产品和服务。

在性能表现上,谷歌公布的数据显示,与此前名为Chirp 3的语音转文字引擎相比,Gemini 3.5 Transcribe在速度和准确性方面均有提升。从用户说话到最终生成转录文本,整体速度预计提升约70%;在实时语音场景下,其错误率已降至5.5%。相比之下,Chirp 3的错误率为7.32%。尽管准确率提升幅度不算显著,但对于经常使用语音输入的用户而言,减少错字意味着后续手动修改的工作量更少,仍属实用改进。

Gemini 3.5 Transcribe的能力不仅限于“听清”用户语音,还试图理解用户真正想表达的含义。在说话过程中,模型可自动删除影响语句流畅度的口头禅;若用户说错后立即修正,模型也能实时调整已生成的文本。此外,用户可提供自定义词汇表,帮助模型更好地识别专业术语和特定领域词汇。该模型目前支持85种语言,并可处理最多包含3名说话者的预录音频。

这一功能也带来一个值得关注的问题:用户需要信任AI能够准确理解自己真正想表达的内容。从Rambler功能的实际体验来看,在较短文本中,模型确实能够较好地清理前后不一致的表达和说话时的磕绊,使文本更自然。但Gemini 3.5 Transcribe并非简单地将语音转换为文字,AI在整理内容过程中可能改变用户原本的措辞。因此,在需要严格保留原话、不能随意修改表述的场景中,这种“智能润色”可能并不适用。

此次发布正值外界等待Gemini 3.5 Pro之际,谷歌率先推出3.5系列中的另一款模型,显示出其在语音AI领域的持续布局。语音转文本作为企业协作、会议记录、客服质检等场景的基础能力,其准确性和处理效率直接影响上层应用的体验。Gemini 3.5 Transcribe在速度和口头禅清理方面的改进,或将为谷歌的办公套件、云服务等产品线带来新的能力支撑。

随着语音交互在移动办公、智能硬件等场景中的渗透率提升,语音转文本模型的实用价值日益凸显。谷歌将Gemini 3.5 Transcribe定位为“理解用户意图”的转录工具,而非单纯的语音转写服务,这一方向也反映出语音AI从“听写”向“理解”演进的趋势。后续该模型在谷歌产品矩阵中的落地效果,以及其在专业场景下的表现,仍有待进一步观察。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
网络安全公司披露AnonyMousKIT钓鱼平台:AI语音冒充苹果客服窃取设备密码
上一篇 4小时前
比亚迪第1万座闪充站明日落成,半年内建成速度刷新行业纪录
下一篇 3小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部