Skip to main content
QUICK REVIEW

[论文解读] Meta-Learning with Sparse Experience Replay for Lifelong Language Learning

Nithin Holla, Pushkar Mishra|arXiv (Cornell University)|Sep 10, 2020
Domain Adaptation and Few-Shot Learning参考文献 58被引用 15
一句话总结

该论文提出了一种结合稀疏经验回放的元学习框架,用于持续语言学习,在真实场景下的单次遍历、无任务标识设置中有效防止灾难性遗忘。通过将元学习与轻量级、随机写入的情景记忆相结合,该方法在使用 BERT 的文本分类和关系抽取基准上实现了最先进性能,同时保持了较低的计算和内存开销。

ABSTRACT

Lifelong learning requires models that can continuously learn from sequential streams of data without suffering catastrophic forgetting due to shifts in data distributions. Deep learning models have thrived in the non-sequential learning paradigm; however, when used to learn a sequence of tasks, they fail to retain past knowledge and learn incrementally. We propose a novel approach to lifelong learning of language tasks based on meta-learning with sparse experience replay that directly optimizes to prevent forgetting. We show that under the realistic setting of performing a single pass on a stream of tasks and without any task identifiers, our method obtains state-of-the-art results on lifelong text classification and relation extraction. We analyze the effectiveness of our approach and further demonstrate its low computational and space complexity.

研究动机与目标

  • 解决在无任务标识或多次训练遍历条件下持续语言学习中的灾难性遗忘问题。
  • 为像 BERT 这类预训练语言模型开发一种内存高效的持续学习方法。
  • 通过元学习与稀疏回放,实现在顺序 NLP 任务间有效知识迁移。
  • 在真实持续学习约束下评估方法,避免常见实验缺陷。
  • 证明情景元学习结合稀疏回放优于现有基于回放和正则化的基线方法。

提出的方法

  • 通过增加情景记忆模块,将在线元学习(OML)和一种神经调制元学习算法(ANML)扩展至 NLP 领域,实现经验回放。
  • 采用稀疏、随机写入机制,将有限数量的过去样本存储在记忆中,并在元优化过程中定期执行回放。
  • 将经验回放视为元学习中的查询集,通过梯度对齐直接优化以防止遗忘。
  • 使用共享输出头,并在数据流上仅进行单次遍历训练,以模拟现实世界的持续学习。
  • 仅在 BERT 顶部的少量可学习投影层(PLN)上执行内循环更新,最大限度减少参数更新和计算成本。
  • 采用元优化器,在新任务学习与回放记忆样本微调之间交替,以稳定学习过程。

实验结果

研究问题

  • RQ1在无任务标识的持续语言学习中,结合稀疏经验回放的元学习能否有效防止灾难性遗忘?
  • RQ2经验回放的频率与稀疏性如何影响持续 NLP 任务中的模型性能?
  • RQ3与标准回放方法相比,周期性回放的情景元学习在准确率和效率方面是否表现更优?
  • RQ4在内存容量受限条件下,该方法的可扩展性如何?是否比以往方法更具内存效率?
  • RQ5相较于更复杂的启发式策略,简单的随机写入记忆选择策略能否实现优异性能?

主要发现

  • OML-ER 在真实持续学习设置下的持续文本分类与关系抽取任务中实现了最先进性能。
  • 即使仅使用 1% 的内存容量,该方法仍保持高准确率,相比 MbPA++ 在 10% 容量下下降 3%,表现出显著的内存效率。
  • 在内存减少的情况下性能保持稳定,文本分类任务在 1% 容量下准确率无显著下降(p=0.952)。
  • 1% 内存容量导致关系抽取准确率出现小幅但显著下降(p=0.040),但整体性能仍保持强劲。
  • 每约 101 步元优化器步骤执行一次回放的情景元学习优于每 600 步执行一次标准回放(p=0.001),表明元优化时机的重要性。
  • 该方法实现快速训练与推理,绝大多数更新集中在 BERT 顶部的单一线性层上,显著降低计算开销。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。