[论文解读] Sentence Embedding Alignment for Lifelong Relation Extraction
本文提出了一种内存高效的持续关系抽取框架,通过显式对齐跨任务的句子嵌入来缓解灾难性遗忘。通过使用基于K-Means的样本选择策略的回放内存,以及一个嵌入对齐模块以稳定表示空间,该方法在FewRel和SimpleQuestions基准上显著优于当前最先进的持续学习方法。
Conventional approaches to relation extraction usually require a fixed set of pre-defined relations. Such requirement is hard to meet in many real applications, especially when new data and relations are emerging incessantly and it is computationally expensive to store all data and re-train the whole model every time new data and relations come in. We formulate such a challenging problem as lifelong relation extraction and investigate memory-efficient incremental learning methods without catastrophically forgetting knowledge learned from previous tasks. We first investigate a modified version of the stochastic gradient methods with a replay memory, which surprisingly outperforms recent state-of-the-art lifelong learning methods. We further propose to improve this approach to alleviate the forgetting problem by anchoring the sentence embedding space. Specifically, we utilize an explicit alignment model to mitigate the sentence embedding distortion of the learned model when training on new data and new relations. Experiment results on multiple benchmarks show that our proposed method significantly outperforms the state-of-the-art lifelong learning approaches.
研究动机与目标
- 解决在动态现实环境中持续关系抽取的挑战,其中新关系随时间不断出现。
- 在不重新训练所有先前数据的情况下,克服神经网络模型在逐步学习新关系类型时的灾难性遗忘问题。
- 开发一种内存高效的方案,避免存储所有历史数据,同时在先前任务上保持高性能。
- 探究对句子嵌入空间进行显式控制是否能提升自然语言处理中持续学习的性能。
- 证明在自然语言处理任务中,简单的内存回放与对齐方法优于复杂的正则化基持续学习方法。
提出的方法
- 使用记忆回放机制(EMR),在每次增量步骤中存储过去任务数据的子集,并在存储数据与新数据的混合数据上重新训练。
- 在句子嵌入空间中应用K-Means聚类,以选择多样化且具有代表性的样本用于内存存储,提升样本效率。
- 引入显式的嵌入对齐模块,以最小化在新任务训练过程中对先前学习的句子表示的失真。
- 通过最小化锚点嵌入(来自先前任务)与当前模型中对应嵌入之间的L2距离来训练对齐模型。
- 保持固定的模型架构,并通过随机梯度下降更新参数,损失函数由当前任务损失与回放样本上的对齐损失组合而成。
- 在推理时使用对齐的嵌入空间,确保对所有先前见过的关系保持一致性。
实验结果
研究问题
- RQ1在持续关系抽取中,简单的内存回放与数据回放是否能优于如EWC和GEM等先进正则化基持续学习方法?
- RQ2句子嵌入空间的失真在多大程度上导致了持续自然语言处理任务中的灾难性遗忘?
- RQ3显式对齐先前任务的句子嵌入是否能提升模型在当前任务和先前见过任务上的性能?
- RQ4记忆采样策略的选择——随机采样、iCaRL或K-Means——如何影响持续关系抽取的性能?
- RQ5轻量级对齐模块是否能在不增加模型复杂度或不改变架构的前提下稳定嵌入空间?
主要发现
- 所提出的记忆回放方法(EMR)结合K-Means采样在FewRel和SimpleQuestions两个基准上均优于当前最先进的持续学习方法,如EWC和GEM。
- 在FewRel上,所有观测任务的平均准确率从0.620(仅EMR)提升至0.632(EMR + K-Means);在SimpleQuestions上,从0.808提升至0.820。
- 在保持模型架构不变的情况下移除嵌入对齐模块导致性能显著下降,证实了其在减少嵌入空间失真方面的有效性。
- K-Means采样策略优于随机采样和iCaRL基采样,在FewRel上平均准确率提升0.016,在SimpleQuestions上提升0.012。
- 该方法在两个基准上均实现了最先进性能,同时保持计算效率并避免模型规模增长。
- 消融实验确认,嵌入空间失真是遗忘的关键原因,显式对齐对实现任务间性能一致性至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。