Skip to main content
QUICK REVIEW

[论文解读] Revisiting DocRED -- Addressing the False Negative Problem in Relation Extraction

Qingyu Tan, Lu Xu|arXiv (Cornell University)|May 25, 2022
Natural Language Processing Techniques被引用 8
一句话总结

本文通过一种迭代的人机协同流程重新标注了4,053篇文档,识别并解决了DocRED数据集中普遍存在的假阴性问题,从而构建了修订后的数据集Re-DocRED。在Re-DocRED上训练和评估的模型相比原始DocRED,F1分数提升了13个百分点,表明不完整的标注显著制约了模型性能。

ABSTRACT

The DocRED dataset is one of the most popular and widely used benchmarks for document-level relation extraction (RE). It adopts a recommend-revise annotation scheme so as to have a large-scale annotated dataset. However, we find that the annotation of DocRED is incomplete, i.e., false negative samples are prevalent. We analyze the causes and effects of the overwhelming false negative problem in the DocRED dataset. To address the shortcoming, we re-annotate 4,053 documents in the DocRED dataset by adding the missed relation triples back to the original DocRED. We name our revised DocRED dataset Re-DocRED. We conduct extensive experiments with state-of-the-art neural models on both datasets, and the experimental results show that the models trained and evaluated on our Re-DocRED achieve performance improvements of around 13 F1 points. Moreover, we conduct a comprehensive analysis to identify the potential areas for further improvement. Our dataset is publicly available at https://github.com/tonytan48/Re-DocRED.

研究动机与目标

  • 识别并解决DocRED数据集中广泛存在的假阴性问题,该问题严重削弱了文档级关系抽取基准评估的可靠性。
  • 通过恢复初始远程监督和标注过程中遗漏的关系三元组,提升DocRED中关系标注的完整性。
  • 提供一个更高质量、经修订的基准数据集(Re-DocRED),以更准确地反映文档中关系的真实分布。
  • 通过确保测试集尽可能完整,实现对最先进关系抽取模型更公平、更可靠的评估。

提出的方法

  • 采用迭代的人机协同标注流程,首先由多个最先进文档级RE模型为每篇文档生成关系候选。
  • 人工标注者审查并验证模型推荐的关系三元组,重点在于恢复原始DocRED中缺失的关系。
  • 该流程优先处理模型对缺失关系具有高置信度的文档,尤其是那些在文本中存在证据但未出现在Wikidata知识库中的关系。
  • 修订后的数据集Re-DocRED包含的三元组数量接近原始DocRED的两倍,重点在于纠正Wikidata知识库中的遗漏和人工标注的空白。
  • 作者在最先进模型上对DocRED和Re-DocRED均进行了广泛的消融实验和对比实验,以验证标注质量提升的影响。

实验结果

研究问题

  • RQ1原始DocRED数据集中假阴性错误的范围和影响有多大?它们如何影响模型评估与性能?
  • RQ2通过人机协同方式对模型推荐的三元组进行重新标注,能在多大程度上缓解文档级关系抽取中的假阴性问题?
  • RQ3当在修订后、更完整的数据集(如Re-DocRED)上进行训练和评估时,最先进关系抽取模型的性能如何变化?
  • RQ4假阴性在DocRED中的主要成因是什么?它们如何源于Wikidata的稀疏性以及推荐-修订标注方案的局限性?

主要发现

  • 原始DocRED数据集存在严重的假阴性问题,许多有效的关系三元组——尤其是那些未存在于Wikidata中的——在标注过程中被遗漏。
  • 修订后的数据集Re-DocRED包含的三元组数量接近原始DocRED的两倍,显著提升了标注的完整性。
  • 在Re-DocRED上训练和评估的模型相比在原始DocRED上训练和评估的模型,平均F1分数提升了13个百分点。
  • 在Re-DocRED上,不同模型之间的性能差距缩小,表明修订后的基准更真实地反映了模型的真实泛化能力。
  • 错误分析显示,许多假阴性源于Wikidata条目缺失,特别是音乐相关文档中的“producer”等关系,这些关系在上下文中可推断但未在知识库中锚定。
  • 本研究证明,不完整的评估集会导致模型评估定义不清,而高质量、经人工验证的基准是实现文档级关系抽取可靠进展的关键。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。