NUS Show Lab 发布 Show-o 系列统一架构,打通自回归与离散扩散并延伸至具身智能

一个真正的“数字生命”大脑,不仅要能深思熟虑,更要在与物理世界碰撞的一瞬间,给出近乎本能的实时反馈。

在 ECCV 2026 现场,新加坡国立大学 Show Lab 负责人寿政教授披露了其团队在多模态统一架构领域的最新研究成果。该研究提出 Show-o 系列模型,在单个 Transformer 架构中同时打通自回归预测与离散扩散生成,并进一步将该架构延伸至具身智能与机器人控制领域。这一成果被视为多模态架构从实验性探索向具身智能底层基础设施演进的重要节点。

长期以来,视觉与语言交叉领域的研究主要沿两条独立路线推进:视频理解致力于将视频转化为文本描述或回答相关问题,视频生成则根据文本提示生成动态画面。业界通常为这两类任务分别训练专属模型。寿政教授指出,AI 发展正迎来一个关键转折点,即从单纯的“语言-视频相互作用”迈入“体验时代”。在这一阶段,模型不再局限于对视觉和文本的关联认知,而是融入“动作”维度,需要具备在物理或虚拟环境中采取行动的能力,并通过环境反馈实现“在做中学”。

在多模态统一的探索中,早期方案如 NEXt-GPT 通过将大语言模型与专用扩散模型外挂组合实现任意模态输入输出,但本质上仍是“大模型加独立生成模块”的分立架构,未实现底座的真正融合。纯自回归范式以 Chameleon 为代表,天然适配文本及图文交错数据,但图像生成时需将图像切分为数百个 Token 并逐 Token 预测,推理速度慢且算力开销大。连续扩散范式生成质量高、速度快,但运行在连续隐空间中,难以与基于离散 Token 的大语言模型在统一空间内无缝融合。

Show-o 架构的核心突破在于将处理文本的自回归机制与处理视觉的离散掩码扩散深度缝合。模型在处理文本理解与生成时保持自回归模式,在进行图像或视频生成时切换至基于离散 Token 的扩散模式,基于 Mask-and-Predict 机制,仅需十几步迭代即可一次性恢复完整视觉 Token。该架构既保留了自回归对多模态文本的建模能力,又实现了扩散模型的高效图像生成,支持任意顺序和组合的多模态输入输出。

从 Show-o 到 Show-2 的演进中,团队重点解决了三个技术瓶颈。其一是双向反哺问题。业内已普遍证实理解能力可以促进生成,但生成能力如何反哺理解仍是前沿课题。团队引入循环一致性监督机制,对于缺乏文本描述的特定领域图像,先利用理解模块生成描述文本,再将该文本作为输入驱动生成模块重建图像,通过对比原始图像与重建图像的差异建立自监督闭环。这一机制使模型能够从海量无标签视频中吸取物理常识,拓宽了 Scaling Law 的数据边界。

其二是帧间流畅度问题。Show-o 初期主要针对静态图像或非连续关键帧,Show-2 则实现了向连续视频生成的跨越。团队开发了通用 3D Tokenizer,能够同时对图像和视频进行统一编解码。在注意力机制设计上,文本部分沿用因果单向注意力以保持前向预测的逻辑性,视觉部分采用完全连接的时空双向注意力,让所有视觉 Token 在空间与时间维度上互相可见,显著提升了生成视频的连贯性与画质。

其三是理解与生成是否应共享同一 Tokenizer 的问题。实验表明,若完全共享同一个编码器,在现有数据条件下理解性能相比专有预训练编码器仍有微小差距。因此 Show-2 采用双路径架构:输入端共享 3D Encoder,模型内部拆分为理解与生成两条路径,理解路径中加入语义层进行特征蒸馏与对齐,既保障视觉理解能力,又维持生成画质。

在完成多模态理解与生成的统一后,团队将这一架构思想延伸至具身智能领域。为支撑相关研究,团队搭建了物理实验环境:桌面端部署固定式双臂系统,分别搭载双指夹爪与五指灵巧手;移动端结合轮式导航底盘与顶部主动机械臂。通过双操纵手柄遥操作采集系统,人类操作员可实时控制机械臂并采集“状态-动作轨迹”数据。

在模型部署层面,传统的视觉-语言模型正向具备动作预测能力的视觉-语言-动作模型演进。VLA 策略模型在 VLM 底座基础上加入动作调制层,可根据视频输入和指令直接预测机器人应采取的物理动作。世界模型能够以当前视觉和动作输入为条件,预测未来环境的像素级变化。世界动作模型则将两者融为一体,实现“既预测动作,又预测未来动作产生视觉结果”的闭环。

落地应用方面,团队采取云端大模型与端侧微调模型相结合的策略。云端前沿大模型规划能力强,但推理延迟较高,单次决策约 8 至 20 秒;基于开源底座微调的本地模型则能实现近乎实时的低延迟控制。团队自研的 Q1 实时骨干网通过精密的特征对齐与蒸馏,实现了远超前沿闭源大模型的推理速度。这一结果表明,具身智能的落地不仅依赖高层语义规划能力,更需要在与物理世界交互的瞬间给出实时反馈。

从统一多模态理解与生成,到打通机器人闭环控制,Show Lab 的研究路径呈现出清晰的演进逻辑:以单一 Transformer 架构为底座,逐步叠加理解、生成、动作预测与世界建模能力。随着具身智能对实时性和数据效率的要求不断提升,此类原生统一架构的探索或将为下一代具身大模型提供重要的技术参考。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
慕尼黑工业大学Angela Dai提出逆向自监督框架,用物理遮挡先验重构3D空间智能
上一篇 1天前
部分AMD平台用户反馈9月Windows 11累积更新引发显卡驱动超时与系统死机
下一篇 1天前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部