[论文解读] Improving Continual Relation Extraction through Prototypical Contrastive Learning
本文提出 CRECL,一种新颖的持续关系抽取框架,通过结合分类网络与原型对比网络,缓解灾难性遗忘。通过将每个实例与所有候选关系的原型进行对比,CRECL 提升了跨任务的特征判别能力,在 TACRED 和 FewRel 上显著优于当前最优基线方法。
Continual relation extraction (CRE) aims to extract relations towards the continuous and iterative arrival of new data, of which the major challenge is the catastrophic forgetting of old tasks. In order to alleviate this critical problem for enhanced CRE performance, we propose a novel Continual Relation Extraction framework with Contrastive Learning, namely CRECL, which is built with a classification network and a prototypical contrastive network to achieve the incremental-class learning of CRE. Specifically, in the contrastive network a given instance is contrasted with the prototype of each candidate relations stored in the memory module. Such contrastive learning scheme ensures the data distributions of all tasks more distinguishable, so as to alleviate the catastrophic forgetting further. Our experiment results not only demonstrate our CRECL's advantage over the state-of-the-art baselines on two public datasets, but also verify the effectiveness of CRECL's contrastive learning on improving CRE performance.
研究动机与目标
- 解决持续关系抽取(CRE)中的灾难性遗忘问题,即模型在学习新关系时性能在旧任务上下降。
- 提升旧任务与新任务之间数据分布的可分性,以增强长期模型性能。
- 在无需对先前数据重新训练的前提下,实现 CRE 中实际的类增量学习。
- 比现有基于记忆或正则化的方法更有效地利用负关系信息。
- 设计一种对比学习机制,在保持当前任务准确率的同时,稳定知识保留。
提出的方法
- 将分类网络与对比网络集成,联合优化关系分类与特征判别。
- 在内存模块中存储关系原型,作为每种关系的 $ L $ 个典型实例的平均嵌入,通过 K-means 聚类学习。
- 通过将每个输入实例与所有关系原型进行对比,实施原型对比学习,促进类内紧凑性和类间可分性。
- 使用对比损失 $ \\_\mathcal{L}_{contrast} $,促使正样本对(实例与其真实关系原型)彼此接近,负样本对彼此远离。
- 在分类分支与对比分支之间共享编码网络权重,以保持一致性并减少参数开销。
- 应用边界损失 $ \\_\mathcal{L}_{mag} $,扩大最优预测与次优预测之间的差距,进一步提升泛化能力。
实验结果
研究问题
- RQ1原型对比学习是否能有效减少持续关系抽取中的灾难性遗忘?
- RQ2对比学习如何提升 CRE 中旧任务与新任务之间数据分布的可分性?
- RQ3所提出的 CRECL 框架在 TACRED 和 FewRel 等基准数据集上是否优于当前最优方法?
- RQ4CRECL 的性能对记忆大小 $ L $ 和原型选择策略的敏感程度如何?
- RQ5对比学习在提升旧任务保留能力的同时,能在多大程度上保持当前任务的准确率?
主要发现
- CRECL 在 TACRED 和 FewRel 上均优于所有当前最优基线方法,在所有持续学习设置下均取得最高的平均 F1 分数。
- 原型对比学习机制显著提升了数据分布的可分性,t-SNE 可视化显示旧任务与新任务关系之间的重叠显著减少。
- 与 RP-CRE 等先前方法相比,CRECL 对记忆大小 $ L $ 的敏感度更低,当 $ L \geq 8 $ 时仍能保持稳定性能,归因于其鲁棒的原型表示。
- 消融实验表明,基于 K-means 的原型选择优于随机采样,CRECL-K 的准确率更低且更不稳定。
- 对比损失 $ \\_\mathcal{L}_{contrast} $ 与边界损失 $ \\_\mathcal{L}_{mag} $ 共同提升性能,且不损害当前任务的准确率。
- CRECL-MAG(结合边界损失与对比学习)在当前任务与历史任务上均表现出最稳定的性能,下降幅度最小。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。