[论文解读] Learning Robust Representations for Continual Relation Extraction via Adversarial Class Augmentation
本文提出对抗性类别增强(Adversarial Class Augmentation, ACA),一种与模型无关的方法,通过增强对相似关系的表示鲁棒性来提升持续关系抽取(CRE)性能。通过在训练过程中利用混合与反转类别增强生成难负样本,ACA有效缓解了灾难性遗忘问题,尤其针对语义相似的关系。该方法在两个基准数据集上持续提升了当前最先进CRE模型的性能。
Continual relation extraction (CRE) aims to continually learn new relations from a class-incremental data stream. CRE model usually suffers from catastrophic forgetting problem, i.e., the performance of old relations seriously degrades when the model learns new relations. Most previous work attributes catastrophic forgetting to the corruption of the learned representations as new relations come, with an implicit assumption that the CRE models have adequately learned the old relations. In this paper, through empirical studies we argue that this assumption may not hold, and an important reason for catastrophic forgetting is that the learned representations do not have good robustness against the appearance of analogous relations in the subsequent learning process. To address this issue, we encourage the model to learn more precise and robust representations through a simple yet effective adversarial class augmentation mechanism (ACA), which is easy to implement and model-agnostic. Experimental results show that ACA can consistently improve the performance of state-of-the-art CRE models on two popular benchmarks.
研究动机与目标
- 探究持续关系抽取(CRE)中灾难性遗忘的根本原因,特别关注语义相似关系的影响。
- 挑战先前研究中关于模型在引入新关系前已充分学习旧关系的常见假设。
- 解决在初始阶段对简单任务进行快捷学习所导致的非鲁棒表示这一被忽视的问题。
- 开发一种简单、高效且与模型无关的方法,在灾难性遗忘发生前提升表示鲁棒性。
- 证明对抗性类别增强可缓解后续任务中的遗忘,尤其在出现语义相似关系时。
提出的方法
- ACA引入两种类别增强策略:混合类别增强与反转类别增强,用于为新关系生成难负样本。
- 在训练过程中,新关系与对抗性增强的类别联合学习,以促使模型形成更具区分性与鲁棒性的表示。
- 该方法应用于每个新任务的初始训练阶段,作为未来遗忘的预防措施。
- ACA与现有回放方法正交,后者侧重于遗忘发生后的知识保留,因此具有互补性。
- 该方法设计轻量化,可直接应用于任何主干CRE模型,无需架构修改。
- 通过组合语义相似但不同的关系的特征或标签构建难负类别,从而在训练中增加区分难度。
实验结果
研究问题
- RQ1为何在CRE中灾难性遗忘会显著影响某些关系,尤其当语义相似关系在后续任务中出现时?
- RQ2现有CRE模型的失败在多大程度上源于早期在简单、非挑战性数据上训练所形成的非鲁棒表示?
- RQ3对抗性数据增强是否能提升CRE中的表示鲁棒性,特别是对语义高度相似的关系?
- RQ4与现有回放方法相比,ACA在性能提升与遗忘缓解方面表现如何?
- RQ5ACA的有效性是否随记忆大小或数据集中关系的相似度而变化?
主要发现
- CRE中的灾难性遗忘与语义相似关系的存在密切相关;当此类关系在后续任务中出现时,性能显著下降。
- 当引入P26关系时,EMAR模型在关系P25上的F1值下降14个百分点,表明因非鲁棒表示导致严重遗忘。
- 在ACA作用下,同一模型在引入P26时,P25的F1值仅下降4个百分点,证明遗忘得到显著缓解。
- 在FewRel数据集上,EMAR+ACA在记忆大小为5、10和20时,分别比EMAR提升2.8、1.1和0.7个百分点的准确率,表明在各类设置下均具有一致增益。
- 错误分析显示,ACA对最大相似度(MS)较高的关系遗忘缓解效果最显著,但与监督基线相比,这些困难样本的性能差距依然存在。
- 在最大相似度最高的组别(G3)中,ACA使F1分数最高提升0.9个百分点,表明其在语义相似关系上的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。