9月4日,微信AI团队宣布开源通用多模态嵌入模型WeMM-Embedding,该模型已在微信线上系统大规模部署,每日调用量达十亿量级。此次开源包含2B、4B、9B三个版本,支持文本、图像、视频、视觉文档以及任意交错的多模态输入。
据官方介绍,WeMM-Embedding选择基于Qwen3.5多模态架构作为统一骨干网络,使图像、视频和文字在模型初始阶段即进行联合处理,而非采用传统的分模态编码后拼接方案。在权威多模态嵌入榜单MMEB-v2上,WeMM-Embedding-9B以80.6分位列第一,2B版本取得77.9分,超过此前领先的8B开源模型。
在实际业务部署方面,WeMM-Embedding已覆盖视频号、直播、公众号、电商与朋友圈等微信核心场景。模型生成的多模态表示被用于候选检索、排序特征构建、用户序列建模和跨域内容理解等环节。在微信内部26项任务基准上,WeMM-Embedding-2B相比同规模基线从60.9提升至72.0,在分类、搜索、跨域匹配、文章相关和视频相关五类任务上均取得提升。
多模态嵌入模型的核心价值在于将不同模态的内容映射到统一向量空间,使系统能够计算图文、视频等内容之间的语义相似度,从而支撑推荐和搜索场景中的匹配需求。微信团队此次开源,为开发者提供了可直接使用的多模态基础模型,降低了构建跨模态检索系统的技术门槛。
目前,WeMM-Embedding的论文、代码仓库及模型权重已分别在arXiv、GitHub和Hugging Face平台开放。随着多模态内容在推荐系统中的应用日益普遍,该模型的发布或将为业界在统一多模态表示学习方向上提供新的参考基线。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。