微软于10月1日发布公告,推出其首个实时流式语音转写模型 MAI-Transcribe-2-Streaming。该模型可在讲话进行时持续输出文字,覆盖60种语言,并支持自动语言检测。目前该模型处于优惠阶段,定价为每小时0.54美元,约合每1000分钟9美元。开发者可通过 Microsoft Foundry、MAI Playground、OpenRouter 等渠道体验或接入。
流式与非流式转写的核心差异在于结果返回方式。流式转写实时返回相关结果,适用于实时对话和字幕场景;非流式转写则在处理完成后一次性返回,适用于录音文件、会议记录和临床文书等完整转写任务。微软此前已推出非流式的 MAI-Transcribe-2,在 Azure Speech 公共预览阶段的价格为每小时0.10美元。
延迟表现是该模型的主要技术指标之一。MAI-Transcribe-2-Streaming 在接收到音频后约100多毫秒内生成首批部分文本,随后根据更多上下文持续修正,并在语句结束后快速提交稳定结果。微软表示,在其实时评估中,文字最快可在语音出现后约320毫秒显示。在第三方评测机构 Artificial Analysis 的测试中,该模型最终转录延迟为0.13秒,最终词错误率为2.50%,在28个流式语音转文字模型中位列第一。
在9月28日公布的 Artificial Analysis 流式语音转文字排行榜中,MAI-Transcribe-2-Streaming 的最终词错误率低于 Grok Voice Transcribe 2.0 Streaming 的2.73%和 ElevenLabs Scribe v2 Realtime 的3.59%。微软同时强调,该模型在最终转录和首次部分转录两个指标上均排名第一。
功能层面,MAI-Transcribe-2-Streaming 支持60种语言,并具备自动、连续的语言检测能力。用户无需在会话开始前手动指定语言,系统可根据语音内容识别语言变化。这一特性降低了多语言场景下的配置复杂度,对跨国企业客服、国际会议记录等场景具有实际应用价值。
从应用场景来看,流式转写使语音应用无需等到用户说完一句话,即可提前理解意图、启动推理或调用工具。例如,客服智能体可以在来电者尚未说完时开始识别问题,实时字幕系统也能更接近“所说即所见”的体验。这类能力对构建低延迟的语音交互智能体具有基础性作用,尤其是在需要即时响应的客服、医疗问诊、实时协作等企业级场景中。
微软此次发布 MAI-Transcribe-2-Streaming,进一步补全了其在语音 AI 领域的产品矩阵。非流式模型面向高精度完整转写,流式模型面向低延迟实时交互,两者形成互补。结合 Microsoft Foundry 和 OpenRouter 等分发渠道,该模型可直接嵌入企业现有的语音处理流程。随着实时语音交互成为 AI 应用的重要入口,流式转写模型的性能竞争正在加速,词错误率和延迟两个核心指标的持续优化将直接影响智能体产品的用户体验。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。