Skip to main content
QUICK REVIEW

[论文解读] Joint Extraction of Entities and Relations Based on a Novel Tagging Scheme

Suncong Zheng, Feng Wang|arXiv (Cornell University)|Jun 7, 2017
Topic Modeling参考文献 27被引用 106
一句话总结

本文提出了一种标注方案,将联合实体-关系提取转化为序列标注任务,并对端到端的 Bi-LSTM/LSTM 模型在带偏置解码目标下进行评估,在 NYT 弱监督数据集上取得了最先进的结果。

ABSTRACT

Joint extraction of entities and relations is an important task in information extraction. To tackle this problem, we firstly propose a novel tagging scheme that can convert the joint extraction task to a tagging problem. Then, based on our tagging scheme, we study different end-to-end models to extract entities and their relations directly, without identifying entities and relations separately. We conduct experiments on a public dataset produced by distant supervision method and the experimental results show that the tagging based methods are better than most of the existing pipelined and joint learning methods. What's more, the end-to-end model proposed in this paper, achieves the best results on the public dataset.

研究动机与目标

  • 推动联合抽取实体与关系并通过将任务转化为标注来减少特征工程
  • 提出一种将实体边界与关系角色编码在标签中的新颖标注方案
  • 开发基于端到端 Bi-LSTM 的模型,使用带偏置解码目标以联合提取实体对与关系。

提出的方法

  • 定义形式为 B/I/E/S-Relation-Role 的标签,O 表示与任务无关的单词
  • 使用预定义的关系集合及角色将三元组提取转换为序列标注
  • 实现一个端到端模型:Bi-LSTM 编码器加上带偏置损失的 LSTM 解码器,以强调关系标签
  • 在远程监督的 NYT 数据集上使用 RMSprop 进行训练,并使用三元组的准确率、召回率、F1 进行评估
  • 与流水线、联合学习及其他端到端标注基线进行比较
  • 偏置参数 alpha 经过调优以在准确率与召回率之间取得平衡

实验结果

研究问题

  • RQ1一个基于标注的方法是否能够有效将联合实体与关系提取转化为序列标注问题?
  • RQ2基于端到端的带偏置解码目标的 Bi-LSTM 模型是否提升了在 NYT-弱监督数据上的三元组提取效果相对于现有方法?
  • RQ3提出的标注方案如何处理关系中两个实体之间的关联,以及偏置对性能的影响?

主要发现

  • 基于标注的端到端模型在 NYT 数据集上领先于大多数流水线与联合学习基线
  • LSTM-LSTM-Bias 在所有测试方法中实现了最佳 F1 分数,超越 CoType 大约 3 个百分点
  • 联合提取模型通常优于流水线方法,且基于标注的方法在很多联合方法中具有竞争力或优于它们
  • 使用带偏置的损失使相关实体之间的连带关系增强,与基线相比减少了单个(不成对)实体
  • 带偏置的 LSTM 解码在精确率与召回率之间取得更好的平衡,在 alpha 大约为 10 时获得最强的 F1

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。