Skip to main content
QUICK REVIEW

[论文解读] Progressive Memory Banks for Incremental Domain Adaptation

Nabiha Asghar, Lili Mou|arXiv (Cornell University)|Nov 1, 2018
Domain Adaptation and Few-Shot Learning参考文献 41被引用 10
一句话总结

本文提出一种用于自然语言处理中增量域适应(IDA)的渐进式记忆库方法,通过在RNN中引入基于注意力机制的记忆库,并在每个新领域到来时逐步扩展记忆槽,实现模型容量的动态增长。与微调或隐藏状态扩展不同,该方法在微调所有参数的同时有效缓解灾难性遗忘,在多领域自然语言推理(MultiNLI)任务上实现了当前最优性能,且对先前领域性能下降极小。

ABSTRACT

This paper addresses the problem of incremental domain adaptation (IDA) in natural language processing (NLP). We assume each domain comes one after another, and that we could only access data in the current domain. The goal of IDA is to build a unified model performing well on all the domains that we have encountered. We adopt the recurrent neural network (RNN) widely used in NLP, but augment it with a directly parameterized memory bank, which is retrieved by an attention mechanism at each step of RNN transition. The memory bank provides a natural way of IDA: when adapting our model to a new domain, we progressively add new slots to the memory bank, which increases the number of parameters, and thus the model capacity. We learn the new memory slots and fine-tune existing parameters by back-propagation. Experimental results show that our approach achieves significantly better performance than fine-tuning alone. Compared with expanding hidden states, our approach is more robust for old domains, shown by both empirical and theoretical results. Our model also outperforms previous work of IDA including elastic weight consolidation and progressive neural networks in the experiments.

研究动机与目标

  • 解决增量域适应(IDA)中的灾难性遗忘问题,其中领域按顺序到达,且仅能访问当前领域的数据。
  • 开发一种方法,在无需从头训练的前提下,保留先前见过领域的知识,同时适应新领域。
  • 提出一种基于记忆的RNN架构,通过渐进式扩展记忆库来增加模型容量,而非通过隐藏状态增长。
  • 证明基于记忆的容量扩展在保留旧领域性能方面比隐藏状态扩展更具鲁棒性。
  • 在单领域与多领域设置下,超越现有IDA方法,包括微调、弹性权重固化(EWC)和渐进神经网络。

提出的方法

  • 将一个循环神经网络(RNN)与一个直接参数化的实值向量记忆库相结合,用于存储特定领域的知识。
  • 在RNN前向传播过程中,通过注意力机制检索记忆向量,实现对相关领域信息的动态访问。
  • 当新领域到来时,逐步向记忆库中添加新的记忆槽,从而在不修改RNN架构的前提下增加模型容量。
  • 使用反向传播对所有模型参数(包括RNN权重和现有记忆库)进行微调,以适应新数据。
  • 通过匹配总参数量,确保与隐藏状态扩展方法的公平比较,从而隔离容量扩展机制本身的影响。
  • 采用自 resampling 的单尾Wilcoxon符号秩检验验证性能差异的统计显著性。

实验结果

研究问题

  • RQ1与标准微调相比,渐进式记忆库扩展是否能有效缓解增量域适应中的灾难性遗忘?
  • RQ2与扩展RNN隐藏状态相比,基于记忆的容量扩展在保留先前领域性能方面是否更具鲁棒性?
  • RQ3在多领域设置下,所提方法与成熟的IDA技术(如弹性权重固化EWC和渐进神经网络)相比表现如何?
  • RQ4随着新领域不断加入,模型是否能维持甚至提升对早期领域的性能,表明其具备稳定持续学习能力?
  • RQ5基于注意力的记忆检索机制是否能在无需联合训练的前提下,实现有效的跨领域知识迁移?

主要发现

  • 所提出的渐进式记忆库方法在源领域和目标领域上的表现显著优于标准微调,且通过Wilcoxon符号秩检验确认了统计显著性提升。
  • 与隐藏状态扩展相比,基于记忆的扩展在源领域上导致的性能下降更小,支持了记忆扩展对已有知识干扰更小的理论假设。
  • 尽管是增量式且无需同时访问所有数据,该方法在所有领域上的性能与多任务学习相当。
  • 在多领域设置中,该模型在所有领域上均优于弹性权重固化(EWC)和原始渐进神经网络,且在旧领域上表现出一致的性能提升。
  • 随着更多领域被加入,先前领域的性能逐渐改善,表明模型表现出稳定持续学习行为,未出现灾难性遗忘。
  • 实证结果表明,记忆库机制即使在每次领域更新后对整个网络进行微调的情况下,也能实现有效的知识保留与迁移。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。