Skip to main content
QUICK REVIEW

[论文解读] Continual Learning for Text Classification with Information Disentanglement Based Regularization

Yufan Huang, Yanzhe Zhang|arXiv (Cornell University)|Apr 12, 2021
Domain Adaptation and Few-Shot Learning参考文献 43被引用 4
一句话总结

该论文提出了一种基于信息解缠的正则化方法(IDBR),用于持续文本分类,通过将隐藏表征分离为任务通用和任务特定的组件,对两者应用不同的正则化策略,以在保留长期知识的同时保持对新任务的灵活性。实验表明,IDBR在五个基准数据集上优于当前最先进基线方法,且灾难性遗忘显著减少。

ABSTRACT

Continual learning has become increasingly important as it enables NLP models to constantly learn and gain knowledge over time. Previous continual learning methods are mainly designed to preserve knowledge from previous tasks, without much emphasis on how to well generalize models to new tasks. In this work, we propose an information disentanglement based regularization method for continual learning on text classification. Our proposed method first disentangles text hidden spaces into representations that are generic to all tasks and representations specific to each individual task, and further regularizes these representations differently to better constrain the knowledge required to generalize. We also introduce two simple auxiliary tasks: next sentence prediction and task-id prediction, for learning better generic and specific representation spaces. Experiments conducted on large-scale benchmarks demonstrate the effectiveness of our method in continual text classification tasks with various sequences and lengths over state-of-the-art baselines. We have publicly released our code at https://github.com/GT-SALT/IDBR.

研究动机与目标

  • 通过区分任务通用与任务特定知识,解决持续文本分类中的灾难性遗忘问题。
  • 在保留先前任务知识的同时,提升模型对新任务的泛化能力。
  • 相比基于回放的方法,减少内存与训练开销。
  • 设计一种正则化策略,对通用与特定表征区别对待,以实现最优知识保留。
  • 在大规模基准数据集上,验证方法在不同任务顺序与序列长度下的有效性。

提出的方法

  • 利用辅助任务将基于BERT的隐藏表征解缠为任务通用与任务特定的组件。
  • 使用下一句预测任务学习任务通用表征,使用任务ID预测任务学习任务特定表征。
  • 应用不同的正则化约束:在任务通用空间施加更强的正则化,任务特定空间施加较轻的正则化,以增强稳定性。
  • 引入一种基于K-均值的记忆选择规则,仅存储前序任务中最具代表性的1%样本。
  • 将正则化与小型情景记忆缓冲区结合,以增强知识恢复能力。
  • 采用双分支分类头,共享头用于通用表征,任务特定头用于特定表征。

实验结果

研究问题

  • RQ1将隐藏表征解缠为通用与特定组件,是否能提升文本分类中的持续学习性能?
  • RQ2对通用与特定表征施加不同强度的正则化,是否能减少灾难性遗忘?
  • RQ3诸如下一句预测与任务ID预测等辅助任务,是否能有效引导表征解缠?
  • RQ4在有限内存预算下,基于K-均值的记忆选择对性能有何影响?
  • RQ5该方法在不同任务顺序与序列长度下是否具有泛化能力?

主要发现

  • IDBR在五个基准数据集上平均准确率达到73.72%,优于当前最先进方法。
  • 消融实验表明,同时使用两种辅助任务(下一句预测与任务ID预测)能带来最大性能提升。
  • 对通用与特定空间均施加正则化至关重要,且在通用空间施加更强正则化能显著减少遗忘。
  • K-均值记忆选择优于随机采样,尤其在具有挑战性的任务顺序下表现更优。
  • IDBR使遗忘度量显著降低,五轮任务后平均遗忘得分为2.89,表明灾难性遗忘明显减少。
  • 该方法在不同任务序列与输入长度下均保持强性能,展现出良好的鲁棒性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。