阿尔伯塔大学提出FAME框架,为持续强化学习建立可求解的遗忘最小化目标

基于以上定义,持续强化学习的知识整合步骤可以显示地写成一个灾难性遗忘最小化的优化问题,这为后续设计双学习算法框架提供了核心原则。

阿尔伯塔大学强化学习团队提出了一套名为FAME(Principled Fast and Meta Knowledge Learners)的持续强化学习框架,试图为持续强化学习中长期存在的灾难性遗忘问题提供原则性的数学分析工具与算法设计范式。该论文已被ICLR 2026收录,论文链接为https://arxiv.org/abs/2603.0090301。

持续强化学习的核心矛盾在于可塑性与稳定性之间的天然张力。智能体在学习新任务后往往会覆盖已有知识,形成灾难性遗忘;而当新旧任务差异较大时,旧知识反而可能阻碍新任务的学习。现有工作提出了经验回放、参数正则化、网络扩展、策略蒸馏等方案,但这些方法多属经验性修复,缺乏统一的算法基础理论来指导各类算法有体系地演进。Demis Hassabis、梁文锋与Ilya Sutskever均曾指出大模型的类似短板:通过微调注入新知识时,模型往往会丢失过往已掌握的技能;即便依靠超长上下文临时读取新信息,也无法将经验真正固化进模型本体。

该研究首先提出两个基础概念。其一,利用两个马尔可夫决策过程对应的最优值函数或最优策略之间的距离,定义两个环境之间的差异,该定义同时吸收了奖励函数和状态转移机制的差异,在数学表达上更为简洁。其二,从各环境下的值函数或策略函数出发定义序列决策中的灾难性遗忘,并特别使用策略在过去不同环境下的状态访问分布对其进行加权。其直观含义是:判断智能体是否遗忘过去任务,应重点关注过去任务中真正重要、真正被访问过的状态和动作,而非对整个状态空间一视同仁。基于以上定义,持续强化学习的知识整合步骤可以被显式地写成一个灾难性遗忘最小化的优化问题。

FAME的设计受到人类学习和记忆系统中海马体与大脑皮层协同机制的启发。快速学习模块模仿海马体,负责知识迁移,将旧知识用于加速新任务的上手;元学习模块模仿大脑皮层,负责知识整合,将新学到的内容并入长期知识库。共同第一作者孙科从统计学角度解释双系统设计的必要性:一个智能体学习一个任务,本质上是在拟合该任务背后的数据分布,新任务到来时数据分布发生变化,指望单一模型同时拟合无穷多个分布面临根本性困难。

在具体机制上,FAME包含两个关键设计。其一是快速学习模块中的自适应热启动。新任务到来时,算法需要在三个候选中做出选择:继承元学习策略、直接微调上一个任务、或随机初始化从头训练。FAME采用统计学中的假设检验,将这一选择转化为one-vs-all检验。若历史知识确能帮助当前任务,则利用元学习初始化加速训练;若过去知识已不适用而新任务与上一任务相似,则直接选择微调;若新任务完全未遇到过,智能体会倾向选择随机初始化。其二是元学习模块的知识整合,快速学习模块完成新任务后,元学习模块依据前述灾难性遗忘最小化目标将新知识并入长期库。在离散动作下,该目标等价于增量式的极大似然目标;在连续动作下,则对应最小化KL散度或Wasserstein距离。这一转化在数学上将持续强化学习与多任务学习之间的模糊界限勾连起来。

实验覆盖MinAtar、Atari和机器人操作的Meta-World环境,跨越离散与连续动作、值函数与策略函数,测试了DQN、PPO、SAC等算法。在平均性能、前向迁移、遗忘三项指标上,FAME相比Reset、微调、平均、PackNet、ProgressiveNet、CompoNet等基线全面占优,且优势随任务序列推进愈加明显。消融实验逐项拆解了自适应热启动、正则化强度和记忆缓冲大小各自的贡献,结论显示先选对起跑点、再将新旧知识整合,两步缺一不可。

对于持续学习是否可被scaling law绕过的讨论,孙科认为,对初级智能而言,通过scaling law确实能缓解一部分灾难性遗忘,但如果目标是超级智能,持续学习始终是核心难题。其理由在于,搜数据、预训练、微调、后训练这条流水线每次都要从头运行,终究难以持续扩展规模。阿尔伯塔大学是强化学习领域的重镇,强化学习之父、图灵奖得主Richard Sutton在此任教。张鸿铭表示,Sutton一直强调真正的智能是在与环境的持续交互中解决问题,同时不遗忘此前掌握的能力。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
Arm发布Neoverse CSS N4平台并上线AI Portal,面向智能体时代重构算力供
上一篇 4小时前
原力灵机DM0.5在RoboColiseum四榜登顶,仿真真机一致性达89.5%
下一篇 3小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部