Skip to main content
QUICK REVIEW

[论文解读] Lifelong Learning using Eigentasks: Task Separation, Skill Acquisition, and Selective Transfer

Aswin Raghavan, Jesse Hostetler|arXiv (Cornell University)|Jul 14, 2020
Multimodal Machine Learning Applications参考文献 45被引用 4
一句话总结

本文提出了eigentask框架用于终身学习,结合生成式回放与基于技能的任务分离,通过唤醒-睡眠周期实现。该方法在持续监督学习中达到最先进性能,并在强化学习中实现正向知识迁移,通过OWVAE生成与任务相关的建议,在StarCraft 2中以10倍少的样本实现比单任务学习高1.5倍的性能表现。

ABSTRACT

We introduce the eigentask framework for lifelong learning. An eigentask is a pairing of a skill that solves a set of related tasks, paired with a generative model that can sample from the skill's input space. The framework extends generative replay approaches, which have mainly been used to avoid catastrophic forgetting, to also address other lifelong learning goals such as forward knowledge transfer. We propose a wake-sleep cycle of alternating task learning and knowledge consolidation for learning in our framework, and instantiate it for lifelong supervised learning and lifelong RL. We achieve improved performance over the state-of-the-art in supervised continual learning, and show evidence of forward knowledge transfer in a lifelong RL application in the game Starcraft2.

研究动机与目标

  • 解决灾难性遗忘问题,并在终身机器学习中实现正向知识迁移。
  • 利用生成模型开发一种可扩展的、内容可寻址的技能记忆系统。
  • 将生成式回放从遗忘缓解扩展至支持正向迁移。
  • 通过基于技能的建议,提升终身强化学习中的高效探索能力。
  • 在持续学习基准和真实世界强化学习环境中,展示性能与迁移能力的提升。

提出的方法

  • eigentask框架将生成模型(生成器)与特定任务的技能(判别模型)配对,形成技能的内容可寻址记忆系统。
  • OWVAE使用多个VAE作为生成器,并在潜在空间中应用似然比检验,将输入分配至eigentasks。
  • 联合损失函数结合生成器与技能损失,通过似然比加权,实现端到端训练。
  • 利用技能预测置信度进行拒绝采样,以过滤分布外的生成样本,提升回放质量。
  • 在强化学习中,框架利用OWVAE检索相关历史技能作为“建议”用于探索,通过混合策略与主策略结合。
  • 唤醒-睡眠周期交替进行任务学习(唤醒)与知识巩固(睡眠),实现持续适应。

实验结果

研究问题

  • RQ1生成式回放能否超越遗忘缓解,实现正向知识迁移?
  • RQ2如何通过结构化生成建模实现任务解耦,以提升终身学习性能?
  • RQ3基于历史经验的技能建议能否提升终身强化学习中的探索与学习效率?
  • RQ4通过eigentasks实现的选择性知识迁移与标准生成式回放相比,在持续学习基准中表现如何?
  • RQ5eigentasks在多大程度上能实现对与先前学习任务相似的新任务的快速适应?

主要发现

  • OWVAE在混合MNIST/FashionMNIST持续学习基准上达到最先进性能,优于以往的生成记忆方法。
  • 该方法展现出优越的任务解耦能力,通过各VAE生成器生成的清晰、高质量样本得到视觉验证。
  • 基于技能置信度的拒绝采样相比标准回放,有效减少遗忘并提升持续学习性能。
  • 在StarCraft 2中,该方法实现了正向知识迁移:在DefeatZerglingsAndBanelings任务中,性能比单任务学习高出1.5倍,且强化学习样本减少10倍。
  • 正向迁移在相似任务间(如战斗到战斗)最为有效,但在不相似任务间因技能选择不匹配而效果减弱。
  • 该框架在StarCraft 2的一个小型游戏上超越了FullyConv策略架构的最佳已发表性能,证明了其实际可扩展性与高效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。