8月20日,美国机器人基础模型公司Generalist AI发布最新模型GEN-1.5,展现出较强的In-Context Learning(上下文学习,ICL)能力。随后,Skild AI也将ICL纳入具身智能的核心叙事。这一技术动向让COCO Matrix(可可矩阵)CEO高宇翔感到兴奋,他认为机器人的ICL范式将成为主流共识,如同ICL能力的出现标志着语言模型从“BERT时代”走向“GPT-3时代”,机器人领域也正在迎来自己的GPT-3时刻。
ICL的核心逻辑是让机器人像人类一样,通过高效利用观察到的上下文来适应和学习新环境与新任务。当前行业主流范式是,机器人每学习一个任务,都需要针对该任务提前采集数据并重新训练模型。这种模式类似于“刷题库”式的学习,一旦测试内容超出题库范围,模型便无法胜任。高宇翔指出,单纯依赖现有具身数据进行Scaling面临巨大困难,具身模型无法照搬大语言模型的经验,因为任务复杂度和数据分布存在本质差异。
高宇翔出身西安交通大学少年班,曾在约翰斯·霍普金斯大学攻读博士学位。2021年GPT-3展现出上下文学习能力时,他便开始思考如何将这种能力迁移至具身智能领域。2024年加入工业界后,他仅凭两台机器,在三个月内成为业内最早跑通全尺寸人形机器人遥操数据采集工作的人之一,并因此获得与全球头部大厂的VLA模型合作机会。2025年第三季度,他花费一百余万元,在全尺寸双足人形机器人上训练出具备一定泛化能力的世界模型。
高宇翔认为,具身智能将比大语言模型更早遭遇数据枯竭和探索效率问题。具身数据不仅数量少,且分布不均匀,部分数据采集难度极高,很难在已有数据上通过内插方式实现泛化。有行业人士估算,若按传统数据收集方式,具身智能领域需要约100万亿美元的投入。在单一任务上,具身数据规模需求相当于自动驾驶的十几万倍甚至更多,这将导致离线数据和强化学习能力提升的边际效应递减。
关于当前热门的“世界模型”概念,高宇翔表示,世界模型本质上是对世界状态的预测,属于统称性术语。行业热捧世界模型的原因在于VLA数据Scaling遭遇瓶颈。目前尚未有哪种数据Scaling方式能将世界模型的预测能力与机器人的泛化操作能力有效挂钩,这一路径仍是未知数。在Scaling方式上,高宇翔将现有方案分为数据、参数和算力三类,但在对延迟和实时性敏感的物理世界中,算力Scaling和参数Scaling带来的推理效率限制将制约其上限。
大语言模型可以在液冷服务器中进行推理,但机器人需要同时处理视觉、听觉、触觉等连续高频信息,对带宽和频率的要求远超语言模型。若机器人无法达到最基本的十几赫兹响应频率,用户便能明显感知到反应迟缓。在聊天框中对话可以等待,但机器人端水杯时反应慢,杯子可能就会掉落。因此,在具身场景中,算力和参数Scaling因物理规律限制而失效,数据Scaling成为唯一可行的方向。
2026年春节后,高宇翔在连办公室都没有的阶段,仅凭ICL技术理念和个人热情搭建起主创团队。目前COCO Matrix是一个20余人的小团队,成员主要来自海内外顶尖高校和实验室,包括学术界ICL方向的顶级研究员和头部实验室的技术人员。创业以来,高宇翔首次公开同步公司在ICL上的进展,他谨慎地将其定义为“初步验证”。他表示,通过训练方式的改变和多样任务数据的构建,模型已涌现出超预期的适应和上下文理解能力。
如果这种能力能够在更大规模、更多任务和更多真实场景中稳定复现,意味着机器人学习新任务的方式将发生根本变化:不再每遇到一个新任务就依赖重新采集大量数据和重新训练模型,而是可以更多地利用现场提供的示范、纠正和历史经验完成适应。相应地,机器人的部署门槛和新任务适配成本也有机会被显著降低。傅利叶创始人顾捷在评估高宇翔的创业想法时表示,如果能从模型范式上有根本变化,这真的会改变行业,看到AGI机会。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。