Xspark AI联合创始人丁文伯提出机器人触觉”脊髓”架构,主张触觉智能独立于视觉模型

触觉智能未必需要拥有视觉大模型那样丰富的语义理解能力,相反,它可能应该更轻、更快、更靠近身体。

2025年,清华大学教授丁文伯以联合创始人兼首席科学家的身份加入具身智能创业公司Xspark AI(无界智航)。该公司提出”慢脑VLM—快脑VTLA+TWAM—脊髓VTA”三层架构,试图为机器人触觉智能建立独立的技术路径。

丁文伯的判断基于对当前主流技术路线的分析。过去两年,具身智能领域普遍延续大模型的Scaling逻辑,通过更多视频、更多机器人轨迹和更大的VLA(视觉-语言-动作模型)提升机器人泛化能力。丁文伯认为VLA的逻辑是成立的,但机器人最终要与物理世界发生接触,仅靠视觉无法解决接触发生后的实时感知与修正问题。他指出,视觉已解决机器人感知世界约99%的问题,触觉的价值在于视觉失效或不够确定时,补上接触之后的信息——杯子是否开始滑动、手指是否捏得太紧、机械臂是否撞到人。

基于这一判断,丁文伯提出”触觉原生智能”概念,主张触觉智能不应作为新模态直接嵌入视觉大模型。他认为触觉信息量远不如视觉丰富,但对反馈效率要求更高,直接融合要么产生大量冗余,要么关键触觉信息被视觉淹没。他以人的脊髓作类比:人快要摔倒时身体先完成反射,而非先识别”我正在摔倒”再决定伸手。触觉智能同样需要足够低的延迟,在滑动、碰撞、失衡发生的一瞬间做出反应。

Xspark AI的三层架构是这一思路的工程化表达。视觉语言模型构成”慢脑”,负责语义理解、高层认知和任务规划;触觉首先进入”快脑”,与视觉、语言和动作共同参与长程任务和灵巧操作;再往下一层,触觉成为”脊髓”的核心信息,在碰撞、滑落、安全等场景下完成更快的局部反应。同一种触觉因此承担两种角色:在快脑中帮助机器人”做得更好”,在脊髓中保证机器人”来得及反应”。

丁文伯也承认,从”触觉很重要”到真正做出一套触觉智能仍有较长距离。硬件层面,不同触觉传感器之间一致性差,同批次产品性能也可能存在明显差异,模型难以像视觉模型一样在不同硬件间直接迁移。数据层面,触觉缺乏互联网时代天然积累的海量图片和视频,同一动作换一个人、一个传感器甚至一个机器人,数据分布都可能变化。更基础的问题在于触觉的表征与嵌入方式——不同传感器采集的力、温度、剪切、振动,能否被转换为与具体硬件无关的共同表征。他将未来两到五年的核心问题概括为三个”跨”:跨传感器、跨模态、跨本体。

在落地路径上,丁文伯倾向于折中方案:短期先做好某一种多模态触觉传感器,再与现有模型融合;预训练阶段聚焦通用能力构建,触觉信息的引入与融合放在灵巧操作的后训练和动作修正阶段。长期来看,他认为触觉最终会形成自己的模型和逻辑。这一判断能否成立,取决于触觉智能能否在硬件一致性、数据积累和表征方法上取得实质性突破。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
阶跃星辰发布StepAudio 3系列语音大模型,多款模型登顶Artificial Analysis全球第
上一篇 3小时前
CrowdStrike CEO 柯兹反对放缓前沿 AI 开发,称潘多拉魔盒已打
下一篇 3小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部