2024年9月19日,在2024云栖大会上,阶跃星辰创始人姜大昕、月之暗面Kimi创始人杨植麟、生数科技首席科学家朱军与极客公园创始人张鹏展开了一场圆桌对话,围绕AI技术发展现状及未来18个月的大模型行业走向进行了深入探讨。讨论的核心议题包括OpenAI o1发布对行业的影响、强化学习新范式对算力和数据的要求,以及AI应用层创业在当前阶段的策略选择。
关于过去18个月AI领域的发展速度,三位嘉宾均认为行业正处于加速阶段。姜大昕从数量和质量两个维度进行了分析。在数量层面,几乎每个月都有新模型、新产品涌现,OpenAI相继发布Sora、GPT-4o和o1,Anthropic推出Claude 3及3.5系列,Google Gemini系列、Groq、Llama等也持续迭代,行业格局从GPT-4一家独大转变为群雄并起的竞争态势。在质量层面,姜大昕特别指出三项突破性进展:GPT-4o实现了多模态能力的深度融合,将此前孤立的视觉理解、视觉生成和声音模型整合在一起;特斯拉FSD v12作为端到端大模型,将感知信号直接转化为控制序列,为智能设备与大模型的结合指明了方向;o1则首次证明语言模型可以具备人脑的慢思考能力,即系统2能力,这是实现归纳世界的前提条件。
杨植麟从纵向和横向两个维度补充了对AI发展节奏的判断。纵向维度上,模型智商持续提升,数学竞赛能力从去年的不及格提升到今年的90多分,代码能力已能击败许多专业编程选手。上下文长度方面,去年大部分模型仅支持4至8K,如今128K已成为标配,部分模型已支持1M甚至10M的上下文长度。杨植麟指出,近期许多进展并非单纯来自scaling,而是源于后训练算法优化和数据优化,这些优化的周期更短,进一步加快了整体发展节奏。横向维度上,Sora在视频生成领域影响力显著,不同模态之间的转化、交互和生成正变得越来越成熟,例如通过一篇论文即可直接生成真假难辨的播客双人对话。
朱军则从学习曲线角度分析了加速现象。大语言模型从2018年发展至今经历了约6年时间,而多模态大模型从去年下半年开始讨论到今年年初实现时空一致性突破,仅用了半年。朱军认为,加速的核心原因在于行业对技术路线的认知和准备已达到较好程度,云设施和计算资源等物理条件也在加速完善。ChatGPT刚出现时行业措手不及,经过一段时间的学习和掌握后,解决新问题的速度明显提升。朱军对高阶AGI的发展持乐观态度,认为技术进步曲线将越来越陡。
针对OpenAI o1的发布,姜大昕表示其推理能力令人惊艳,在自测的多个query中均表现出显著提升。他认为o1的核心意义在于两点:第一,o1首次证明LLM可以具备人脑的慢思考能力,即系统2能力。此前GPT的训练范式基于“预测下一个token”,这决定了其仅具备系统1能力,而o1采用强化学习的新训练框架,从而带来了系统2能力。第二,o1提升了AI的能力上限,为行业提供了新的技术范式参考。
杨植麟在对话中提及,o1背后的强化学习新范式对算力和数据提出了新的要求。传统的预训练范式依赖海量静态数据,而强化学习需要模型在交互中不断试错和优化,这对算力基础设施的实时响应能力和数据质量提出了更高标准。对于AI应用层创业,杨植麟认为,随着模型能力的持续提升,新的应用机会不断涌现,例如Cursor通过自然语言直接编写代码,未来此类软件将越来越普及。应用层创业者需要关注模型能力边界的变化,在模型能力与用户需求之间寻找匹配点。
展望未来18个月,三位嘉宾认为大模型行业将继续保持加速态势。姜大昕提出AGI的演进路线分为模拟世界、探索世界和归纳世界三个阶段,系统2能力是归纳世界的前提条件,o1的发布标志着行业向归纳世界迈出了关键一步。杨植麟强调,纵向智商提升与横向多模态拓展将同步推进,后训练算法优化和数据优化将缩短技术迭代周期。朱军则表示,随着行业对技术路线认知的成熟和计算资源的持续投入,AGI的发展速度会越来越快,但能力向实际用户的辐射存在行业差异,广泛感知可能滞后于技术进步本身。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。