Skip to main content
QUICK REVIEW

[论文解读] RDSGAN: Rank-based Distant Supervision Relation Extraction with Generative Adversarial Framework

Guoqing Luo, Jiaxin Pan|arXiv (Cornell University)|Sep 30, 2020
Topic Modeling参考文献 22被引用 4
一句话总结

RDSGAN 是一种生成对抗框架,通过对抗训练学习真实正样本的分布,并利用基于排序的远程监督选择有效样本,从而减少远程监督关系抽取中的假阳性。其在 NYT 数据集上达到 85.1% 的平均 Precision@N 和 0.39 的 AUC,优于强基线模型,展现出更优的噪声抑制与性能表现。

ABSTRACT

Distant supervision has been widely used for relation extraction but suffers from noise labeling problem. Neural network models are proposed to denoise with attention mechanism but cannot eliminate noisy data due to its non-zero weights. Hard decision is proposed to remove wrongly-labeled instances from the positive set though causes loss of useful information contained in removed instances. In this paper, we propose a novel generative neural framework named RDSGAN (Rank-based Distant Supervision GAN) which automatically generates valid instances for distant supervision relation extraction. Our framework combines soft attention and hard decision to learn the distribution of true positive instances via adversarial training and selects valid instances conforming to the distribution via rank-based distant supervision, which addresses the false positive problem. Experimental results show the superiority of our framework over strong baselines.

研究动机与目标

  • 为解决远程监督关系抽取中因标签噪声导致的假阳性问题。
  • 通过对抗训练结合软注意力与硬决策,建模真实正样本的分布。
  • 自动生成大量有效(真实正样本与真实负样本)样本,用于构建干净的训练数据。
  • 在保留传统硬移除方法中丢失的有用信息的同时降低噪声。
  • 通过一种新颖的基于排序的远程监督机制,提升关系抽取性能。

提出的方法

  • 该框架使用生成器,基于头实体、关系和尾实体三元组生成句子嵌入。
  • 判别器通过对抗训练,区分真实正样本与生成样本,从而学习真实正样本的分布。
  • 训练完成后,固定判别器,并利用其根据样本与真实正样本的相似度,对一个包中的实例进行排序。
  • 排序模块应用选择性注意力,识别并选择最符合学习到分布的实例。
  • 生成器与排序损失及关系分类损失联合优化,为每个包生成干净且有效的实例。
  • 基于排序的远程监督选择排名靠前的实例作为训练数据,最大限度减少假阳性。

实验结果

研究问题

  • RQ1对抗训练能否有效学习噪声远程监督数据中真实正样本的分布?
  • RQ2通过排序结合软注意力与硬决策,能否提升关系抽取中的噪声抑制效果?
  • RQ3基于排序的远程监督是否在保留有用信息的同时,比传统注意力或移除方法更有效地减少假阳性?
  • RQ4生成式框架能否自动产生高质量的训练样本,从而提升关系抽取性能?
  • RQ5RDSGAN 在基准数据集上的精确率、召回率和 AUC 指标上,与最先进模型相比表现如何?

主要发现

  • RDSGAN 在 N=100、200 和 300 时分别达到 88.9%、85.3% 和 81.1% 的 Precision@N,显著优于所有基线模型。
  • 在 NYT 数据集上,RDSGAN 的 AUC 相较于 DSGAN+ATT 提升 8.98%,相较于 PDCNN+TATT 提升 7.69%。
  • PR 曲线分析显示,RDSGAN 在所有召回率水平下均保持更高的精确率,且下降速度更慢。
  • 在较高召回率下,该方法平均比 PDCNN+TATT 提高 6% 的精确率,表明其具有更强的鲁棒性。
  • 对抗训练与基于排序的监督相结合,能有效减少假阳性,同时保留有用信息。
  • RDSGAN 证明了在远程监督中,结合生成建模与排序机制进行干净数据合成的优越性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。