[论文解读] DARE: Data Augmented Relation Extraction with GPT-2
DARE 提出了一种关系抽取的数据增强方法,通过微调 GPT-2 为每种关系类型生成合成训练样本,随后将这些样本与真实数据结合,微调基于 BERT 的分类器。该方法在三个生物医学关系抽取基准上实现了高达 11 F1 分的提升,并取得了新的 SOTA 结果,平均优于先前方法 4.7 F1 分。
Real-world Relation Extraction (RE) tasks are challenging to deal with, either due to limited training data or class imbalance issues. In this work, we present Data Augmented Relation Extraction(DARE), a simple method to augment training data by properly fine-tuning GPT-2 to generate examples for specific relation types. The generated training data is then used in combination with the gold dataset to train a BERT-based RE classifier. In a series of experiments we show the advantages of our method, which leads in improvements of up to 11 F1 score points against a strong base-line. Also, DARE achieves new state of the art in three widely used biomedical RE datasets surpassing the previous best results by 4.7 F1 points on average.
研究动机与目标
- 解决监督式关系抽取中的类别不平衡与训练数据有限问题,这是真实世界生物医学 NLP 应用中的常见挑战。
- 探索使用自回归语言模型(如 GPT-2)不仅用于文本生成,还作为下游分类任务的数据增强引擎的可行性。
- 通过受控微调 GPT-2,将真实标注数据与合成生成样本结合,提升基于 BERT 的关系抽取器性能。
- 证明 GPT-2 生成的数据能够有效缓解数据稀缺与类别不平衡问题,且不会引入显著噪声导致模型性能下降。
- 在三个广泛使用的生物医学关系抽取基准上建立新的 SOTA 成绩。
提出的方法
- 使用真实数据集中仅正样本,为每种关系类型微调一个独立的 GPT-2 模型。
- 利用微调后的 GPT-2 模型生成反映目标关系类型句法与语义模式的合成训练实例。
- 将生成的合成数据与原始真实数据集合并,形成增强后的训练集。
- 训练一组基于 BERT 的关系分类器集成模型,每个模型在增强数据的不同子集上进行训练,以降低方差并提升鲁棒性。
- 基于实证消融实验,采用生成数据与真实数据 1:1 的比例,该比例下性能表现最佳。
- 在完整增强数据集上微调最终的 BERT 分类器,以生成最终模型。
实验结果
研究问题
- RQ1GPT-2 是否能被有效微调以生成高质量、关系特定的训练样本,从而提升下游关系抽取性能?
- RQ2与传统类别不平衡学习技术(如类别加权和平衡袋采样)相比,通过 GPT-2 实现的数据增强在 F1 分提升方面表现如何?
- RQ3为最大化性能而不引入损害分类器性能的噪声,生成数据与真实数据的最佳比例是多少?
- RQ4使用 GPT-2 生成的数据是否能实现在标准生物医学关系抽取基准上的 SOTA 性能?
- RQ5所提出的方法是否能在具有不同数据稀缺性和类别不平衡水平的多样化生物医学关系抽取数据集上实现良好泛化?
主要发现
- DARE 在强基线模型基础上实现了最高达 11 F1 分的提升,显著增强了关系抽取性能。
- 在 CDR 数据集上,DARE 将 F1 从 0.70(SOTA)提升至 0.73,提升 3 分,且在所有评估方法中取得最高 F1。
- 在 ChemProt 数据集上,DARE 将 F1 从 0.65(SOTA)提升至 0.73,提升 8 分,并创下新 SOTA 记录。
- 在 DDI2013 数据集上,DARE 将 F1 从 0.75(SOTA)提升至 0.78,提升 3 分,且优于所有基线方法。
- 在三个基准上,该方法平均比先前 SOTA 提升 4.7 F1 分,确立了新的 SOTA 成绩。
- 实证消融显示,当生成数据与真实数据比例为 1:1 时性能达到峰值,进一步增加比例则因引入噪声导致性能下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。