Skip to main content
QUICK REVIEW

[论文解读] Continual Learning for Sentence Representations Using Conceptors

Tianlin Liu, Lyle Ungar|arXiv (Cornell University)|Apr 18, 2019
Topic Modeling参考文献 24被引用 7
一句话总结

本文提出了一种基于概念器(conceptors)的持续学习框架,用于对句子表示进行增量式更新,适用于连续的语料库。通过使用与语料库无关的特征进行初始化,并对概念器矩阵执行布尔运算,该方法有效抵抗灾难性遗忘,在语义文本相似性任务上的表现优于从零开始训练的基线模型,甚至在某些情况下超越零样本基线模型。

ABSTRACT

Distributed representations of sentences have become ubiquitous in natural language processing tasks. In this paper, we consider a continual learning scenario for sentence representations: Given a sequence of corpora, we aim to optimize the sentence encoder with respect to the new corpus while maintaining its accuracy on the old corpora. To address this problem, we propose to initialize sentence encoders with the help of corpus-independent features, and then sequentially update sentence encoders using Boolean operations of conceptor matrices to learn corpus-dependent features. We evaluate our approach on semantic textual similarity tasks and show that our proposed sentence encoder can continually learn features from new corpora while retaining its competence on previously encountered corpora.

研究动机与目标

  • 为解决在动态 NLP 环境中,训练数据按顺序到达时的持续句子表示学习挑战。
  • 克服线性句子编码器在对合并语料库从零开始重新训练时产生的灾难性遗忘问题。
  • 实现在无需任何训练语料进行初始化的前提下,实现零样本句子表示学习。
  • 开发一种方法,在学习新语料库的特征的同时,保持对先前见过语料库的强性能表现。
  • 通过语义文本相似性基准,证明基于概念器的适应方法在持续学习场景中的有效性。

提出的方法

  • 使用与语料库无关的特征初始化句子编码器,以支持零样本推理。
  • 使用概念器矩阵表示特定语料库的特征,并通过布尔运算(如交集、并集)在新语料库上更新这些矩阵。
  • 采用改进的 SIF 类框架,其中句子向量通过词向量的加权平均计算,并投影远离已学习的共性语篇方向。
  • 通过各新语料库导出的概念器矩阵更新共性语篇方向,利用矩阵运算保留过去知识。
  • 利用回声网络中的矩阵概念器,实现在无需完整重训练的前提下,高效且增量式的适应。
  • 使用超参数 α=1 和 a=0.001(如 SIF 中所用),以确保与基线方法的一致性比较。

实验结果

研究问题

  • RQ1能否在不依赖任何训练数据的情况下,初始化句子编码器,使其生成有意义的句子表示?
  • RQ2能否在不损失对先前数据性能的前提下,对线性句子编码器进行增量式更新,以适应新语料库?
  • RQ3与在合并语料库上从零开始训练的方法相比,基于概念器的持续学习方法性能如何?
  • RQ4所提出的方法在顺序学习场景中,对灾难性遗忘的抵抗能力有多强?
  • RQ5使用概念器进行零样本初始化,能否在未见过的语料库上超越微调或重新训练的模型?

主要发现

  • 所提出的 CA 编码器在持续添加更多语料库时,对先前见过的语料库性能优于从零开始训练的方法,表现出对灾难性遗忘的有效抵抗。
  • 零样本 CA 编码器在大多数语料库上的表现优于从零开始训练的 SIF 基线模型的时间平均性能,表明其在无任何训练数据的情况下具备强大的泛化能力。
  • 在语义文本相似性任务中,CA 编码器在所有语料库上均保持较高的皮尔逊相关系数(PCC),且随时间推移性能下降极小。
  • 从零开始训练的 SIF 基线模型在每次添加新语料库后性能明显下降,而 CA 编码器仅表现出轻微退化。
  • 该方法通过在概念器矩阵上执行布尔运算,有效学习了与语料库相关的特征,实现在无需完整重训练情况下的增量适应。
  • 该方法在多种语料库上均表现出鲁棒性,包括新闻、论坛、推文、图像字幕和 WordNet,时间序列与平均性能评估结果均显示其优越性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。