9月14日,上海具脑磐石科技有限公司在2026浦江创新论坛·类脑具身智能分论坛上正式发布全球首代类脑认知世界模型Cog-WM 1.0。该模型基于成体系类脑神经机制研发,完成了从主动探索具身导航到价值引导具身操作的能力验证,为具身智能逼近人脑高泛化能力提供了新的技术路径。
据算法团队披露,在导航任务中,Cog-WM 1.0与认知地图导航业界SOTA——发表于Nature Communications的BSC-Nav(Ruan et al., 2026)Baseline相比,实现了无预建图自主导航,导航成功率提升超过10%。在操作任务中,该模型在具身操作任务基准上均优于基于海量数据预训练的SOTA(π0.5),最多提升16%以上。目前,Cog-WM 1.0已在轮式人形、四足机器人等多构型机器人本体上完成验证,具备无预建图条件下的自主导航与路径规划、时空记忆检索、空间关系问答与寻物等核心能力,并在轮式人形机器人上验证了操作能力。
具脑磐石创始人兼CEO朱森华表示,具身智能正处于从实验室走向产业落地的关键阶段,“低数据依赖、高泛化能力”是这一进程的核心命题。Cog-WM 1.0初步验证了系统借鉴人脑功能神经认知机制、并以之提升算法模型能力上限的可行性。
当前具身智能领域面临三重技术挑战:如何降低对海量任务数据和特定环境适配的依赖、如何让历史信息真正被有效利用、如何提高长程任务的完成度。具脑磐石的判断是,这三问并非通过扩大数据规模或参数规模就能解决的工程问题,而是范式层面的结构性问题。Cog-WM 1.0的应对思路是不再沿“用更多数据补更多场景”的路径外推,而是回到智能的本源——人脑认知机制。
在技术架构上,Cog-WM 1.0借鉴人脑认知地图中组织记忆、选择性更新信息、预测后续状态的机制,并与JEPA(联合嵌入预测架构)结合,在模型提取的抽象特征空间中学习未来状态变化。其核心机制包含三部分:感知编码与目标调控,即在隐空间而非像素层面重建世界,根据目标调控只预测对决策有用的抽象表征;时空记忆内容与结构分离,使空间结构可跨任务复用,并通过惊异更新机制只对“意外”信息投入学习;隐空间多层级预测,支持跨时空尺度的分层预测,以应对陌生环境中的长程探索。
导航与操作在同一套类脑机制框架下采用了不同的实现路径。导航侧建立显式空间记忆并据此预测探索方向;操作侧在训练中学习不同时间跨度的状态变化,并利用执行经验改进策略。两个方向的完整方法均已通过arXiv论文公开。
在导航任务中,Cog-WM Nav 1.0将空间记忆与前瞻预测绑定,在记忆的隐空间里结合任务目标与既有环境记忆预测后续空间表征与探索子目标,再综合目标语义与路径代价选择下一步行动。在HM3D-ObjectNav子集上,导航成功率由78.50%提升至86.89%,相较BSC-Nav提升8.39个百分点,相对提升10.69%,路径效率同步由47.70提升至48.35,且无需预置地图先验。目前,Cog-WM Nav 1.0已在四足机器人上完成部署,并应用于巡检、巡逻场景的客户现场,此前亦在多款构型的轮式人形本体上完成验证与适配。
在操作任务中,Cog-WM Manip 1.0通过多时间尺度预测,让模型在训练中同时学习近期动作后果与后续任务状态,建立当前动作与任务进展之间的联系,并引入价值引导的经验学习机制。在统一复现协议下,该模型在三大主流操作基准上的成功率均超越使用海量数据预训练的行业基线。消融实验显示,能力提升具有明确的机制归因:纯策略80.0%,加入局部预测81.6%,加入多时域预测82.0%,完整方法84.6%(LIBERO-Plus)。在光照变化、视角迁移、背景纹理改变等扰动条件下,Cog-WM Manip 1.0仍能保持高可靠任务完成率。
从行业视角看,Cog-WM 1.0的发布反映出具身智能领域正在出现一条区别于“扩大数据与参数规模”的技术路线。该路线试图通过借鉴人脑神经认知机制,在降低数据依赖的同时提升模型在开放环境中的泛化能力。这一方向能否在更广泛的场景和任务中持续验证,将影响具身智能从实验室走向产业落地的节奏。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。