阶跃星辰发布StepAudio 3系列语音大模型,多款模型登顶Artificial Analysis全球第

StepAudio 3系列分别面向几类核心场景:真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作。

9月15日,阶跃星辰正式发布StepAudio 3系列语音大模型,包含StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music五款模型。目前上述模型均已上线阶跃星辰开放平台。据官方介绍,该系列模型分别面向真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作等核心场景。

在实时语音交互方向,StepAudio 3 Realtime支持原生全双工实时对话。该模型在Artificial Analysis Conversational Dynamics榜单中以98.9%的综合得分排名全球第一,在Speech Reasoning榜单中以99.7%的语音推理准确率同样位列全球第一。官方表示,该模型能够判断对话节奏,处理用户临时打断和连续反馈,同时理解语义、语气、情绪、副语言和环境声音。在技术架构上,StepAudio 3 Realtime支持推理与语音生成并行,Tool Call和长任务可异步执行,不阻塞当前语音会话,用户可在任务运行期间继续交流。

语音识别方面,StepAudio 3 ASR将高精度语音识别与大语言模型的上下文理解、知识和推理能力相结合,支持中文、英文、方言、中英混说、长音频及专业领域等多类场景识别。该模型能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入,在医疗、法律、金融、汽车、编程等领域提升专业表达的识别效果。在Artificial Analysis非流式语音识别准确性榜单中,StepAudio 3 ASR的词错误率仅为1.7%,并列全球第一。

语音生成方面,StepAudio 3 TTS定位为面向实时交互场景的真人级语音生成模型,在音色基底、语调层次、节奏律动和气口停顿等方面贴合人类自然口语模式,能够还原笑声、迟疑、结巴、重复、改口等副语言表现。该模型基于流式生成架构,实现生成与播放同步进行,可满足实时语音应用需求。

在完整音频内容生成方向,StepAudio 3 Gen支持基于自然语言描述和参考音频,统一生成人声、音效、环境音和背景音乐。用户只需描述角色、场景和剧情,无需针对特定角色或场景进行额外训练。模型支持对多个角色的音色、说话方式、语气、情绪、方言口音及副语言特征进行精细控制,并可指定对白、音效、环境声和背景音乐出现的时间与顺序。该能力可应用于影视、动画、游戏、广播剧、有声书和短视频等内容的制作流程。

音乐创作方面,StepAudio 3 Music不仅支持从零生成音乐,还支持基于ABC记谱法控制的多轮交互创作,涵盖歌曲创作、清唱配乐、歌曲翻唱等功能。用户可提供歌词、清唱、参考歌曲、ABC记谱法等多种输入,通过自然语言控制曲风、人声、旋律、节奏、乐器、情绪、段落和制作质感。模型对主歌、副歌、桥段、间奏等歌曲结构以及跨段落的旋律发展、能量变化和演唱表达进行了建模。在清唱配乐场景中,用户提供一段清唱,模型即可理解其中的旋律、节奏和情绪,并补充和声、节奏、乐器和完整编曲。

从行业角度看,语音大模型的竞争正从单一的识别或合成能力,转向覆盖实时交互、音频内容生成和音乐创作的全链路能力。阶跃星辰此次一次性发布五款模型并在多个第三方基准中取得领先成绩,表明国内语音大模型在实时对话动态性、语音推理准确率和识别精度等维度已具备国际竞争力。随着这些模型在开放平台上线,开发者可将其集成至智能客服、车载交互、内容生产等企业级场景,语音AI在ToB领域的落地进程有望进一步加速。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
Brillio加入Salesforce前置部署工程合作伙伴网
上一篇 1小时前
CrowdStrike CEO 柯兹反对放缓前沿 AI 开发,称潘多拉魔盒已打
下一篇 57分钟前

发表回复

登录后才能评论
分享本页
返回顶部