Skip to main content
QUICK REVIEW

[论文解读] WebRED: Effective Pretraining And Finetuning For Relation Extraction On The Web

Róbert Ormándi, Mohammad Saleh|arXiv (Cornell University)|Feb 18, 2021
Natural Language Processing Techniques参考文献 27被引用 7
一句话总结

WebRED 引入了一个大规模、多样化、由人工标注的关系抽取数据集,包含约 110K 个强监督样本,均来自网络文本,并配以约 200M 个弱监督预训练样本。该论文表明,在弱监督数据上预训练后,再在高质量人工标注数据上微调预训练模型,可显著提升 F1 分数,优于仅使用远程监督或从零开始训练的模型。

ABSTRACT

Relation extraction is used to populate knowledge bases that are important to many applications. Prior datasets used to train relation extraction models either suffer from noisy labels due to distant supervision, are limited to certain domains or are too small to train high-capacity models. This constrains downstream applications of relation extraction. We therefore introduce: WebRED (Web Relation Extraction Dataset), a strongly-supervised human annotated dataset for extracting relationships from a variety of text found on the World Wide Web, consisting of ~110K examples. We also describe the methods we used to collect ~200M examples as pre-training data for this task. We show that combining pre-training on a large weakly supervised dataset with fine-tuning on a small strongly-supervised dataset leads to better relation extraction performance. We provide baselines for this new dataset and present a case for the importance of human annotation in improving the performance of relation extraction from text found on the web.

研究动机与目标

  • 解决现有关系抽取数据集的局限性,这些局限包括标签噪声(远程监督)、领域特异性或规模过小。
  • 利用跨多个领域和写作风格的真实网络文本,创建一个大规模、多样化且高质量的人工标注关系抽取数据集。
  • 证明将大规模弱监督预训练与在较小但高质量的人工标注数据集上微调相结合,可显著提升关系抽取性能。
  • 为强监督在减少假阳性、提升模型精确率和泛化能力方面的重要性提供实证证据。

提出的方法

  • 通过 Wikidata 属性使用远程监督方法从网络文本中收集约 200M 个弱监督样本,以支持大规模预训练。
  • 通过从多样化网络来源选取句子,并使用 Wikidata 属性的一个子集人工标注实体-关系对,创建约 110K 个样本的人工标注数据集。
  • 采用多分类分类框架,每个样本为(标记句子,关系类型)对,其中实体以 #{SUBJ} 和 #{OBJ} 明确标注。
  • 采用两阶段流水线:先在弱监督数据集(WebRED_DS)上预训练,然后在人工标注子集(WebRED_H2+1)上微调。
  • 使用 BERT 风格的 Transformer 模型进行关系分类,其输入表示同时编码句子和实体角色。
  • 应用后处理和过滤策略,以去除低质量的弱标签,并确保预训练数据中标签的一致性。

实验结果

研究问题

  • RQ1与仅使用其中一种数据类型相比,结合大规模弱监督预训练与在较小高质量人工标注数据集上微调的混合训练策略,是否能提升关系抽取性能?
  • RQ2监督质量(远程监督 vs. 人工标注)如何影响不同关系类型下的模型精确率、召回率和 F1 分数?
  • RQ3关系类型间的数据不平衡在多大程度上影响模型性能?预训练在缓解此问题方面起到什么作用?
  • RQ4预训练数据中句子长度和关系频率如何影响关系抽取模型的泛化能力和鲁棒性?
  • RQ5远程监督中的标注准确率(即误报率)对下游模型性能有何影响?人工标注在纠正此问题方面起到何种作用?

主要发现

  • 在 200M 个弱监督样本上预训练后,再用 110K 个高质量人工标注样本进行微调,可显著提升 F1 分数,优于从零开始训练或仅使用弱监督的模型。
  • 在 'country' 关系上,经人工标注数据微调的模型精确率为 0.81,召回率为 0.58,而仅预训练的模型精确率为 0.58,召回率为 0.63,表明因负样本质量更高,精确率得到显著提升。
  • 对于高误报率关系如 'diplomatic relation'(99% 误报率),微调模型的 F1 达到 1.00,而仅预训练模型仅为 0.01 F1,凸显强监督在纠正噪声标签中的关键作用。
  • 随着句子长度增加,性能有所下降,但预训练并微调的模型在所有长度上均保持显著更高的 F1 分数,尤其在长序列中表现更优。
  • 预训练频率较高的关系类型性能更优,但超过某一阈值后增益趋于平缓,表明数据平衡对实现最优泛化至关重要。
  • 仅在人工标注数据上训练的模型召回率(0.58)低于预训练并微调的模型('spouse' 关系为 0.86),证实即使在高质量数据上微调,大规模弱数据预训练对模型覆盖能力仍至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。