2018年图灵奖得主、深度学习三巨头之一Yann LeCun在ECCV 2026大会上发表Keynote演讲《World Models: Enabling the next AI revolution》,对当前AI行业的主流技术路线提出系统性反思。他指出,仅依靠语言和token训练的大语言模型无法达到人类水平智能,也无法跨越物理世界这道门槛,真正的下一章在于让AI系统从视频、传感器与交互中学习并构建世界模型。
LeCun在演讲中明确表示,当下人工智能的能力与动物和人类的学习效率相比差距悬殊。AI能写代码、做数学、通过律师考试,但通用家用机器人和L5级全自动驾驶汽车至今缺位。他以自动驾驶为例:一个17岁少年约20小时练习即可学会开车,而行业拥有数十亿小时行车数据,却仍造不出L5级自动驾驶汽车。接近L4水平的系统依赖大量工程化设计和显式世界模型,而非端到端模仿学习。
围绕“世界模型”这一2026年行业热词,LeCun梳理了四条技术路线的根本分歧。第一条以Sora、Genie为代表,赌视频生成中物理规律能从像素中自然涌现;第二条以李飞飞联合创立的World Labs为代表,从底层表征锁定三维一致性;第三条以英伟达Cosmos、Omniverse为代表,将显式物理引擎作为机器人训练场;第四条即LeCun本人押注的JEPA(联合嵌入预测架构),不生成未来,只在抽象表征空间中预测未来。四条路线的核心分歧在于:机器理解物理世界,究竟该复刻它,还是推理它。
LeCun认为“预测像素”本身是伪命题。他以摄像头拍摄房间角落为例:下一帧内容取决于镜头外是否有人进入、光线是否变化,而这些信息在当前帧中根本不存在。JEPA的思路是让编码器先丢弃不可预测的细节,仅保留可预测、可规划的结构,再在抽象表征空间中进行预测和规划。
演讲最后,LeCun给出三条建议:不再死磕生成式模型,不再研究LLM,转向联合嵌入、抽象表征与世界模型。他引用莫拉维克悖论指出,计算机能完成复杂积分和棋类任务,却难以复现动物都能做到的简单动作。在他看来,智能的本质不是陈述性知识和技能的堆积,而是面对新处境时快速发明新技能、解决新问题的能力。这一判断对当前以Scaling Law为主叙事、以语言模型为通用智能路径的行业共识构成直接挑战。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。