谷歌于9月5日发布公告,宣布在Gemini应用和Gemini API中正式上线最新音乐生成模型Lyria 3.5。这一动作标志着谷歌的音乐AI能力从内部实验工具Google Flow Music走向主流用户与开发者生态,成为其AI产品矩阵中面向创意内容生成方向的重要补充。
此次发布的Lyria 3.5模型支持生成包含数段副歌、桥段等完整结构的歌曲,时长可达数分钟。同时,谷歌还提供了另一款名为Lyria 3 Clip的预览模型,该模型始终生成30秒的循环片段,主要用于快速试听和循环预览场景。两款模型均通过Gemini应用面向普通用户开放,开发者则可通过Google AI Studio、Vertex AI及Gemini API调用相关接口。
在输出格式方面,两种模型默认生成MP3音频文件,其中Lyria 3.5额外支持WAV格式输出,满足不同场景下对音质和编辑灵活性的需求。文档显示,开发者可以在文本提示之外,同时上传最多10张图像,模型将依据视觉内容进行音乐创作,这一多模态输入能力扩展了音乐生成的创意边界。
在内容安全与版权溯源层面,所有由Lyria 3.5生成的音频均通过Interactions API统一调度,并嵌入SynthID隐形水印。该水印技术由谷歌DeepMind开发,具备抵抗压缩、重采样等常见音频处理的能力,可用于版权追踪与内容溯源。这一设计考虑到了AI生成内容在分发和二次创作过程中可能面临的版权认定难题。
从产品定位来看,Lyria 3.5的发布延续了谷歌将生成式AI能力深度整合进现有产品矩阵的策略。此前,谷歌已在其音乐实验项目Google Flow Music中测试了Lyria系列模型,本次向Gemini应用及开发者平台的开放,意味着该技术正式进入商业化部署阶段。对于企业用户而言,通过Vertex AI调用Lyria 3.5意味着可以在统一的云平台上完成模型调用、资源管理与合规审计,降低了将AI音乐生成能力集成到业务系统中的门槛。
在行业层面,Lyria 3.5的发布进一步加剧了AI音乐生成赛道的竞争。目前,该领域已有OpenAI的Jukebox、Meta的MusicGen以及初创公司Suno等参与者,各家在生成质量、时长控制、版权保护等维度上各有侧重。谷歌的优势在于其拥有完整的云基础设施(Google Cloud)、开发者工具生态(AI Studio、Vertex AI)以及Gemini应用庞大的用户基数,能够将模型能力快速触达不同层级的用户。
不过,谷歌官方文档中暂未公布Lyria 3.5的定价信息。对于企业客户而言,模型调用成本将是评估其实际应用价值的关键因素之一。考虑到生成式音频模型通常对算力要求较高,如何在保证生成效果的同时控制推理成本,将是谷歌在推动该模型规模化落地过程中需要解决的问题。
从更宏观的视角看,Lyria 3.5的发布是谷歌在生成式AI领域持续投入的一个缩影。过去一年中,该公司陆续将Gemini模型能力扩展到文本、图像、视频、代码等多个模态,音乐生成是这一扩展路径上的最新一环。随着多模态生成技术的成熟,AI在创意产业中的应用正从单点工具向全流程工作流渗透,这也对内容生产、版权管理和分发机制提出了新的要求。Lyria 3.5所采用的SynthID水印方案,或许会成为行业在解决AI生成内容溯源问题上的一种参考范式。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。