腾讯混元多模态团队近期发生新的人事变动。据媒体报道,原xAI多模态理解负责人蔺旭东已离开xAI,加入腾讯混元担任多模态内容生成算法负责人。这是混元多模态团队在持续组织调整背景下的最新一次人员引入。
公开资料显示,蔺旭东2018年毕业于清华大学,后在哥伦比亚大学攻读博士,研究方向涵盖嵌入学习、视频分析和生成模型,曾参与哥伦比亚大学与Facebook AI合作的Vx2Text项目。该项目将视频、声音等多模态信息转换为类似语言token的向量,统一送入语言模型融合处理。博士毕业后,蔺旭东加入DeepMind参与Gemini相关多模态预训练和后训练工作,2025年加入xAI负责多模态理解方向。
蔺旭东的加入发生在腾讯混元多模态团队持续调整的背景下。2025年1月,腾讯杰出科学家胡瀚接替刘威负责混元多模态大模型研发;同年下半年,胡瀚从多模态模型部调入大语言模型部旗下前沿技术研究组,汇报线改为向姚顺雨汇报。2026年3月,腾讯撤销成立近十年的AI Lab,部分人员并入混元大语言模型部。7月初,前OpenAI研究员田永龙加入腾讯负责视觉语言模型方向;随后腾讯TEG撤销大语言模型部和多模态模型部,合并成立基础模型部,由姚顺雨任负责人。此后胡瀚离职创业,混元多模态基础模型负责人钟钊也暗示即将离开HunyuanVideo与HunyuanImage项目。
腾讯此前在多模态领域的主要产品包括HunyuanVideo和HunyuanImage。HunyuanVideo于2024年12月以130亿参数成为当时全球最大的开源视频生成模型,2025年11月发布的1.5版本将参数压缩至83亿。HunyuanImage于2024年5月推出,2025年迭代出2.0、2.1和3.0版本,2026年1月推出带推理能力的Instruct版本。此外还有专门生成单体3D模型的Hy 3D产品线。
蔺旭东的加入被外界视为腾讯多模态研发方向调整的信号。其此前在Vx2Text项目中积累的多模态理解经验,与混元当前对内容生成算法的需求存在契合。随着基础模型部的成立和姚顺雨全面负责,腾讯多模态研发正在从生成能力向理解与行动能力方向整合。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。