当地时间 9 月 18 日,SpaceXAI 正式发布语音转文本模型 Grok Voice Transcribe 2.0。该版本在维持原有定价不变的前提下,将转录错误率降低约一半,并在 Artificial Analysis 榜单的全部 32 款流式模型中准确率排名第一。
据官方介绍,Grok Voice Transcribe 2.0 基于 Grok Voice 底层的音频基础模型构建。Grok Voice 目前已在多项实际业务中落地,包括每天承接数万通客服电话、转录数百万小时的视频旁白,以及驱动实体硬件中的语音智能体,其中涵盖特斯拉车辆搭载的 Grok 助手。这一业务规模为模型迭代提供了真实的音频数据基础。
除公开基准测试外,SpaceXAI 还基于线上实际业务中采样的四个内部数据集,对模型的词错误率进行了系统评测。这四个测试集分别覆盖客服电话音频、与 Grok 的日常英语对话、电话号码与邮箱及地址等口述信息,以及多语种简短语音指令。官方表示,Grok Voice Transcribe 2.0 在四个数据集上的表现均全面超越 1.0 版本。
定价方面,Grok Voice Transcribe 2.0 与 1.0 版本完全一致。批量转录为每小时音频 0.10 美元,实时流式转录为每小时 0.20 美元。说话人分离、精确时间戳以及自定义关键词功能均已包含在内,无需额外付费。
从行业角度看,语音转文本模型的竞争焦点正从单纯的准确率指标转向真实业务场景下的鲁棒性。公开基准测试通常使用标准化音频,而客服电话、口述信息等场景往往伴随背景噪声、口音差异和语速变化,对模型的泛化能力要求更高。SpaceXAI 选择同时公布公开榜单排名与内部业务数据集评测结果,意在强调模型在实际部署环境中的表现。
价格策略方面,在模型能力提升的同时保持定价不变,反映出当前语音 AI 基础设施市场的竞争态势。随着大模型厂商纷纷将语音能力作为 API 服务输出,单位推理成本与定价的平衡成为企业客户选型的关键考量。Grok Voice Transcribe 2.0 将说话人分离、时间戳和自定义关键词等此前常作为增值功能收费的能力纳入基础定价,可能对同赛道的语音转文本服务形成一定价格压力。
目前,SpaceXAI 尚未披露 Grok Voice Transcribe 2.0 在非英语语种上的详细评测数据,多语种场景的实际表现仍有待更多第三方验证。该模型已通过 API 形式对外开放,企业客户可按批量或实时流式两种模式调用。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。