具身智能进入大脑竞赛阶段,数据与架构成为行业分水岭

没有大脑,具身智能这个概念都会被直接证伪。

具身智能行业正经历从机械表演向智能决策的关键转型。过去两年,机器人完成舞台表演被视为技术突破,如今行业普遍追问机器人的实际应用价值。这一转变标志着具身智能进入比拼“大脑”的新阶段,具备自主决策能力的机器人成为行业竞争的核心分水岭。

当前多数机器人的底层模型采用VLA架构,仍停留在预设框架内的有限执行。卡内基梅隆大学教授、Skild AI联合创始人Deepak Pathak指出,机器人对物理世界缺乏真实理解。在2025年机器人世界大会上,有具身智能公司创始人同样表示,机器人的智力水平尚不及一只边牧,这凸显了“大脑”研发的紧迫性和价值。

具身智能“大脑”的研发面临三重挑战:数据稀缺、数据封闭和仿真鸿沟。谷歌曾组织16人团队耗时17个月、投入上千万美元,仅采集23万条真机轨迹。各家企业积累的数据不愿共享,形成行业瓶颈。仿真数据虽能缓解数据不足,但存在sim-to-real的迁移鸿沟,世界模型作为解决方案仍处于构想阶段。

在数据积累层面,智元机器人走真机数据路线。2025年1月,智元第1000台通用具身机器人量产下线,这些机器人同时作为数据采集器,构建了包含超100万条真机轨迹、217个任务的AgiBot World数据集,规模较公开数据集大一个数量级。在该数据集上预训练的策略,平均表现比谷歌OXE数据集高30%,但真机数据采集成本高、扩张曲线呈线性。

银河通用选择合成数据路径,其SynGrasp-1B数据集包含十亿级仿真抓取数据,基于此训练的GraspVLA模型实现98.3%的抓取成功率,并达成零样本泛化。银河通用认为,具身智能所需数据中99%可由高质量合成数据完成,仅1%需要真机采集。以零售场景为例,百亿级合成数据预训练后,仅需一人一天的真机数据即可完成微调,边际成本趋近于零。

在模型架构层面,Physical Intelligence专注模型研发,不涉及机器人本体制造,通过架构设计结合在线强化学习迭代,实现机器人连续数小时工作。星海图2025年开源G0采用双系统VLA设计,2026年G0.5转向单模型自回归序列,将推理、规划与行动统一到单一token流中,以继承大语言模型的scaling law。智元提出的ViLLA架构引入隐式动作标记,使VLM语义知识流入动作生成,其首个基座大模型GO-1在指令理解与位置泛化任务上表现优于RDT和π0模型。

当前机器人大脑的架构路线尚未定型,真机数据与合成数据各有优劣,双系统与单模型架构仍在探索。具身智能企业能否跨越周期,取决于其在数据积累与架构创新上的持续投入,行业竞争正从硬件展示转向智能能力的实质性突破。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
Manus宣布恢复独立运营,创始团队肖弘、季逸超、张涛继续领导公司
上一篇 2小时前
百丽时尚副总裁季燕利:企业AI落地前提是先完成自身工程化建设
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部