谷歌近日发布开源多模态嵌入模型EmbeddingGemma 2,该模型基于Gemma 4架构构建,参数量为7.4亿,量化后在手机端运行仅需191MB内存。与此前版本相比,EmbeddingGemma 2的核心升级在于将嵌入能力从单一文本模态扩展至多模态统一处理,可同时支持文本、代码、图像、视频和音频的嵌入表示。
嵌入模型是检索增强生成(RAG)和语义搜索等应用的基础组件,其作用是将非结构化数据映射为高维向量,使系统能够基于语义相似度进行匹配和检索。此前,多模态嵌入通常需要为不同模态分别部署模型,或在云端完成推理后再返回结果,这在延迟、成本和数据隐私方面均存在限制。EmbeddingGemma 2将多模态处理能力压缩至端侧可运行的规模,意味着手机、笔记本电脑等终端设备可以在本地完成跨模态检索任务,无需将数据上传至云端。
从技术指标看,7.4亿参数量在嵌入模型中属于中等偏小规模。谷歌通过量化技术将模型压缩至191MB内存占用,使其能够在消费级移动设备上运行。这一内存占用水平与当前主流手机应用的内存开销相当,具备实际部署的可行性。端侧推理的另一个优势在于离线可用性,对于网络条件受限或对数据隐私要求较高的场景,本地嵌入推理可以避免数据外传。
EmbeddingGemma 2采用开源方式发布,开发者可将其集成至自有应用中。这一策略与谷歌近年来在Gemma系列模型上的开放路线一致。在嵌入模型领域,开源方案此前以文本模型为主,多模态开源嵌入模型的选择相对有限。EmbeddingGemma 2的发布为开发者提供了一个可本地部署的多模态检索基础组件,尤其是在需要处理图文混合内容的搜索、推荐和知识管理场景中。
从行业影响来看,端侧多模态嵌入模型的成熟将推动一类新型应用的落地。例如,用户可以在手机相册中通过自然语言描述搜索包含特定场景或物体的照片和视频,而无需依赖云端服务;企业可以在本地设备上构建跨文本、图像和音频的内部知识库检索系统,在满足数据合规要求的同时降低推理成本。此外,端侧嵌入与端侧大模型的结合,有望进一步减少对云端算力的依赖,使更多AI功能在离线环境下可用。
当前,嵌入模型市场的竞争正在加剧。除谷歌外,多家厂商和开源社区也在推进多模态嵌入能力的研发。EmbeddingGemma 2的差异化在于其端侧运行能力和多模态统一处理架构。随着终端设备算力的持续提升和模型压缩技术的成熟,端侧嵌入推理有望成为移动AI应用的标准配置之一。谷歌此次发布进一步降低了多模态检索的技术门槛,其后续在开发者社区的采用情况和实际部署效果值得关注。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。