具身智能距离真正的ChatGPT时刻还有多?

只有当能力同时转化为足够低的使用成本、足够普适的产品接口,并触发大规模采用与认知同步,技术里程碑才会成为产业时刻。

8月22日,第二届世界人形机器人运动会百米大型组预赛中,宇树科技旗下机器人以12.41秒的成绩完赛,小组排名垫底。一年前,该赛事400米项目的冠军正是宇树。两天前,宇树科技创始人王兴兴在世界机器人大会主论坛上重申了对具身智能“ChatGPT时刻”的预判:快则2到3年、慢则5到10年,届时机器人的泛化能力将使其在80%的陌生场景中通过语音或文字指令完成约80%的任务。赛场表现与宏大愿景之间的落差,让关于“具身智能骗局论”的讨论再度升温。

所谓“ChatGPT时刻”,本质上是能力涌现、成本骤降、病毒式传播三条曲线同时触及阈值的共振产物。2022年11月ChatGPT发布后,约5天用户破百万,两个月后月活过亿,成为史上增长最快的消费级AI应用。但支撑这一时刻的Transformer架构早在2017年就已诞生,GPT系列在此基础上经过大规模自监督预训练和指令微调才最终成型。从架构论文发表到产品击穿公众认知,间隔了整整五年。GPT-3在2020年6月就已具备粗糙可用的能力,直到两年半后三条曲线才完成共振。

具身智能的物理交互属性决定了其技术难度远高于大语言模型。语言模型的核心任务是预测下一个词元,离散且容错,输出错误可重新生成;机器人则需要连续输出每一帧的力矩控制,零容错,一次失误即造成真实的物料损耗与安全风险。具身智能需跑通感知、理解、拆解、规划、执行的五步闭环,技术栈从VLM、VLN、VLA延伸至世界动作模型,每一级都要新增此前不存在的能力模块。当前行业的能力曲线卡在跨场景泛化与安全执行关,固定基准普遍逼近97%-99%,但切换场景后指标明显下滑,如RoboCasa成功率为53.9%,VLABench得分仅为47.4。

成本曲线方面,合成数据与人类视频数据已大幅降低训练成本,但真机校准与上岗验证仍是不可移除的刚性支出。据行业统计,具身智能全行业融资规模已接近千亿元,远快于研发投入和验证转化的实际速度。扩散曲线则卡在跨客户复制关,上半年行业出货量同比增长近300%,但生产级场景占比不足两成,可跨厂复制的标准化任务包尚未形成。三条曲线分别卡在不同节点,意味着行业整体仍处于技术验证向规模化落地过渡的早期阶段。

9月3日,OpenAI发布GPT-6 Astra,在ARC-AGI-3测试中取得99.9%的成绩,但并未引发类似ChatGPT发布时的产业级共振。这一案例说明,单次能力跃升并不足以构成产业时刻,只有当能力转化为足够低的使用成本、足够普适的产品接口,并触发大规模采用与认知同步,技术里程碑才会成为真正的产业时刻。数字世界尚且如此,在本体、部署与安全成本更重的物理世界,具身智能更难以凭一次模型发布完成三条曲线的合取。

具身智能的“ChatGPT时刻”大概率不会是单点爆发。技术、成本、扩散三条慢力量曲线决定真实进度,尽管推进缓慢且存在刚性约束,却是这一时刻的真正决定因素;资本定价、公众情绪、人才潮汐等快力量制造短期波动与时刻幻觉,但不决定真实节点。产业发展的节点将分层落地:先形成开发者层的基座模型标准,再出现客户层的可复制任务包,最后才是公众层面的通用认知,整体呈渐进式渗透而非一夜奇观。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
腾讯WorkBuddy开放平台上线,Agent生态的Token成本账待解
上一篇 1小时前
银河通用发布双足机器人银河星仔,预订24小时突破200台
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部