Skip to main content
QUICK REVIEW

[论文解读] Improving Neural Relation Extraction with Positive and Unlabeled Learning

Zhengqiu He, Wenliang Chen|arXiv (Cornell University)|Nov 28, 2019
Natural Language Processing Techniques参考文献 21被引用 5
一句话总结

该论文提出了一种新颖的用于神经关系抽取的正样本与未标记样本(PU)学习框架,该框架利用强化学习来选择正样本句子,并在袋(bag)级别上联合建模正样本与未标记样本。通过将关系嵌入融入强化学习的状态表示,并融合正样本袋与未标记样本袋的表征,该方法在真实世界数据集上显著且一致地超越了强基线模型。

ABSTRACT

We present a novel approach to improve the performance of distant supervision relation extraction with Positive and Unlabeled (PU) Learning. This approach first applies reinforcement learning to decide whether a sentence is positive to a given relation, and then positive and unlabeled bags are constructed. In contrast to most previous studies, which mainly use selected positive instances only, we make full use of unlabeled instances and propose two new representations for positive and unlabeled bags. These two representations are then combined in an appropriate way to make bag-level prediction. Experimental results on a widely used real-world dataset demonstrate that this new approach indeed achieves significant and consistent improvements as compared to several competitive baselines.

研究动机与目标

  • 通过利用正样本与未标记样本句子,解决基于远程监督的关系抽取中的噪声标注问题。
  • 通过充分利用通常被丢弃或错误地视为负样本的未标记实例,改进袋级别的关系分类。
  • 设计一个强化学习智能体,利用包含句子、关系及已选正样本嵌入的状态表示,选择正样本句子。
  • 提出一种联合表征学习机制,将正样本袋与未标记样本袋的表征进行融合,以增强关系分类性能。
  • 证明关系嵌入在强化学习状态表示中的有效性,以及在PU学习中使用未标记数据对关系抽取的益处。

提出的方法

  • 训练一个强化学习智能体,针对每个实体-关系对对句子进行正样本或未标记样本的分类,其状态表示包含句子嵌入、关系嵌入以及先前已选正样本的嵌入。
  • 强化学习智能体选择高质量的正样本句子,形成正样本袋,其余句子则被归入未标记袋。
  • 使用独立的编码器为正样本袋和未标记样本袋学习两种不同的神经表征,以捕捉其各自特征。
  • 将正样本袋与未标记样本袋的表征进行拼接,并输入最终分类器,实现袋级别的关系预测。
  • 联合训练句子选择器与关系分类器,以同时提升选择准确率与最终的关系分类性能。
  • 显式地将关系嵌入融入强化学习状态表示中,以引导选择过程,从而提升模型性能。

实验结果

研究问题

  • RQ1在PU学习框架中联合建模正样本与未标记样本句子,是否能超越仅使用正样本的性能?
  • RQ2将关系嵌入融入强化学习智能体的状态表示,是否能带来更优的句子选择与下游关系分类性能?
  • RQ3当未标记样本不被视作负样本时,其使用是否能带来显著的性能提升?
  • RQ4基于强化学习的选择器与关系分类器的联合训练,如何影响整体系统性能?
  • RQ5当未标记数据被适当地表征并整合后,其对最终关系分类的贡献是什么?

主要发现

  • 所提方法在广泛使用的现实世界关系抽取数据集上,显著且一致地超越了多个强基线模型。
  • 将关系嵌入融入强化学习状态表示,可带来显著的性能提升,如消融研究及图4与图5所示。
  • 在训练过程中使用未标记句子,而非将其丢弃或视为负样本,可带来更好的泛化能力与更高的F1分数。
  • 消融研究证实,未标记数据的使用以及在强化学习状态中引入关系嵌入,对实现最优性能至关重要。
  • 句子选择器与关系分类器的联合训练,能实现更好的对齐,从而提升最终预测的准确率。
  • 该模型优于现有方法,后者或忽略未标记数据,或错误地将其分类为负样本,证明了所提PU学习策略的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。