中美研究者在新加坡对谈持续学习:Agent经验如何写入模型参数仍待解

从「拥有经验」到「真正提升能力」,中间存在一个缺口:短期记忆存在上下文中,但长期记忆可能需要等到下一轮预训练,才能把所有数据写入权重。

8月25日,在新加坡举办的AGI Playground 2026舞台上,AMI Labs创始科学家、AMI Labs新加坡负责人林敏与Mind Lab创始人兼总裁Andrew Chen围绕大模型的持续学习问题展开了一场深度对谈。两位研究者均长期从事持续学习领域研究,此次对话聚焦一个当前AI行业的核心矛盾:Agent产品每天产生海量交互数据,但模型能力并不会随之自动增长。

林敏现负责AMI Labs的模型训练系统与底层基础设施。AMI Labs是Yann LeCun离开Meta后联合创立的新公司,专注于构建能够理解现实世界的智能系统。Andrew Chen所在的Mind Lab是心洲科技(Mindverse)旗下的前沿研究实验室,主要方向是通过LoRA和后训练技术,让模型从新的交互和任务经验中持续获得能力。2026年7月底,Mind Lab发布了基于GLM 5.2进行后训练的模型Macaron V1,采用混合LoRA架构,原生支持持续学习。

对谈的核心问题直指当前Agent产品的结构性缺陷。Andrew Chen指出,目前Agent产品已经积累了大量的用户交互和对话历史,但模型本身没有改变,它们仍然无法从这些经验中学习。林敏对此的回应是,当前模型体系中存在短期记忆与长期记忆之间的断裂:短期记忆存储在会话上下文中,而长期记忆的更新往往需要等到下一轮预训练,周期可能长达数月。他认为,人类大脑中存在将短期记忆自动转化为长期记忆的机制,而当前这一代模型缺失的正是这一环节。

Andrew Chen补充认为,这不仅是算法问题,也是基础设施问题。持续学习需要能够按天、按小时甚至按批次更新模型参数的基础设施,同时需要足够强的模型来自动化这一过程。如果完全依赖人类研究者设计流程,速度无法支撑持续化和个性化的需求。

在记忆与学习的关系上,两位研究者给出了不同视角。林敏从计算成本角度分析,非参数学习将数据直接存入列表,推理阶段查找复杂度可达O(n²);而深度学习通过多轮梯度下降将数据转化为权重,训练成本高但推理效率接近O(1)。这本质上是增量更新记忆的速度与检索使用记忆的速度之间的权衡。Andrew Chen则将「记住」与「学习」视为同一条连续谱的两端,极端记住是把一切写进硬盘,极端学习是真正理解概念。他透露,Mind Lab的实验显示,当同一事实从不同角度重复出现四次,一个概念就会从中浮现,语言模型能够理解这一概念,这也是预训练背后的一部分原理。

关于事实、习惯与因果规律应存储在模型体系的哪一层,林敏认为它们都是难以区分的记忆形式,KV cache、梯度权重、循环神经网络的状态,本质上只是记忆的不同形态,主要取舍在于使用成本。他主张消除短期记忆与长期记忆之间的明确边界,让所有信息持续流入长期记忆。Andrew Chen则提出,世界模型、状态转移函数、LoRA、KV Cache以及线性注意力状态都可以承载不同更新频率的记忆,其中Mind Lab尤其看好LoRA,因为其在效率和表征能力上表现突出,在不可变状态机基础设施上训练和部署LoRA时展现出多项优良特性。

在防止新能力与旧能力冲突的问题上,Andrew Chen介绍Mind Lab的方案是让不同能力进入不同的LoRA适配器,从参数层面实现天然隔离,在需要时才加载到基础模型中。林敏对此回应称,目前尚无很好的解决方案,他多年来一直在寻找一种算法,能够在持续更新模型信息的同时避免灾难性遗忘,但这一问题仍未得到根本解决。

从行业视角看,这场对谈揭示了当前大模型从「拥有经验」到「提升能力」之间的关键缺失环节。随着Agent产品在企业服务场景中加速落地,模型能否在不经过完整重训练的前提下持续吸收新经验,将直接影响Agent产品的长期价值和个性化能力。林敏与Andrew Chen分别代表的世界模型路线与LoRA后训练路线,为这一问题的解决提供了两种不同的技术路径,但两者都尚未给出完整的工程答案。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
鸿蒙智行新品发布会一文汇总:华为余承东回应问界调整,智界 RX/R7 上市,享界 V8 亮相
上一篇 2小时前
HeyVigo推出Infinite Canvas,将多模态AI视频创作整合至单一画布
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部