清华大学智能产业研究院(AIR)首届博士生李健雄已毕业,并创立具身智能公司本溯智能(BASAL Intelligence,简称BASAL)。该公司已获得五源资本领投,常春藤资本、线性资本、华山资本WestSummit Capital参与投资。团队核心成员包括首席科学家、清华AIR副教授詹仙园,以及7名长期合作的年轻研究者。
据本溯智能称,创始团队组建前,核心成员分别拿到字节跳动Top Seed、英伟达、小米等企业的高薪offer和海外高校博士录取机会,合计放弃的年薪总包接近4000万元,其中李健雄个人放弃的最高年薪总包接近千万元。
当前具身智能的主流路线,是先预训练一个基础模型,再针对每个任务做后训练部署交付。这套范式在工厂标准化场景下已经跑通,但一旦环境、物体或作业流程发生变化,机器人往往需要重新采集数据、重新训练。面对现实世界中无穷无尽的长尾场景和长尾任务,这条路的规模化天花板显而易见。
本溯智能对此有一个直接的判断:这本质上还是工业自动化的延伸,并不是真正意义上的具身智能。在团队看来,真实世界中与物理环境交互的动作信息,很难通过语言被完整、准确地描述;现有以语言为中心的VLA路线,也因此在精细操作和跨场景泛化上存在先天局限。本溯智能的目标,是让机器人具备现场学习的能力:当面对训练阶段从未见过的新场景、新任务或新本体时,无需重新训练模型,只需通过少量人类示范和自主尝试,在几分钟内完成快速学习与适应。
本溯智能将其方法论归结为智能决策的第一性原理,提出“动作原生的In-Context具身基础模型”技术路线。区别于现有方案以语言为中心,本溯智能将动作作为模型的核心表达方式,让模型直接学习与世界交互的动作、任务反馈、失败纠正以及人类示范之间的关系。模型的大部分容量用于动作生成,并通过长上下文组织机器人的连续物理交互,使机器人能够根据此前的动作、结果、失败和反馈,持续调整后续决策。
支撑上述路线的,是团队自2024年起持续研发的两项核心技术——跨具身模型X-VLA与高效隐空间世界模型ODEWorld。X-VLA聚焦跨本体动作表达,仅使用不足1000小时的预训练数据,便在多项第三方评测中取得领先结果;其团队基于该模型,从400多支参赛队伍中脱颖而出,获得IROS 2025智元机器人挑战赛总冠军。ODEWorld则通过连续物理时间的隐空间建模,为长时序物理信息表达和机器人的In-Context Learning提供更高效的技术基础。据公开资料显示,本溯智能是国内最早系统探索跨本体快速适应与In-Context具身学习方向的团队之一。
本溯智能关注的是具身智能规模化的一个关键成本矛盾:越来越多的企业愿意引入机器人,却难以承受每换一个场景就要重新采集数据、重新训练的高昂代价。如果In-Context具身学习真的成立,部署成本将随着机器人学习经验的积累持续下降,而非随场景增多线性攀升。从X-VLA在IROS竞赛中的冠军表现,到ODEWorld在长时序物理建模上的技术积累,本溯智能已在学术层面展示出相当的技术深度。团队接下来面临的关键挑战,在于将几分钟现场学习的能力,在更多真实场景、更多本体、更多任务类型中持续验证。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。