Skip to main content
QUICK REVIEW

[论文解读] Attending to All Mention Pairs for Full Abstract Biological Relation Extraction

Patrick Verga, Emma Strubell|arXiv (Cornell University)|Oct 23, 2017
Topic Modeling被引用 8
一句话总结

本文提出双线性关系注意力网络(BRAN),一种神经网络模型,通过自注意力机制与双线性打分,同时在完整生物医学摘要中预测所有提及对之间的关系,在无需外部知识库的情况下,于Biocreative V CDR数据集上实现了最先进性能。该模型通过联合实体识别与弱监督数据,利用文档级别的多实例学习减少稀疏提及级标注带来的噪声,从而提升泛化能力。

ABSTRACT

Most work in relation extraction forms a prediction by looking at a short span of text within a single sentence containing a single entity pair mention. However, many relation types, particularly in biomedical text, are expressed across sentences or require a large context to disambiguate. We propose a model to consider all mention and entity pairs simultaneously in order to make a prediction. We encode full paper abstracts using an efficient self-attention encoder and form pairwise predictions between all mentions with a bi-affine operation. An entity-pair wise pooling aggregates mention pair scores to make a final prediction while alleviating training noise by performing within document multi-instance learning. We improve our model's performance by jointly training the model to predict named entities and adding an additional corpus of weakly labeled data. We demonstrate our model's effectiveness by achieving the state of the art on the Biocreative V Chemical Disease Relation dataset for models without KB resources, outperforming ensembles of models which use hand-crafted features and additional linguistic resources.

研究动机与目标

  • 解决现有关系抽取模型仅关注单句、单一对实体的局限性,这些模型无法捕捉生物医学文本中常见的跨句关系。
  • 通过同时建模文档内所有提及对,提升生物文本中的关系抽取性能,实现长距离上下文感知。
  • 通过在文档内应用多实例学习,减少因提及级标注稀疏导致的训练噪声。
  • 在不依赖外部知识库或手工设计语言特征的前提下,于 Biocreative V CDR 数据集上实现最先进性能。

提出的方法

  • 模型采用基于 Transformer 的自注意力编码器,并使用字节对编码(BPE)表示子词标记,从而有效处理罕见或未登录的生物学术语。
  • 每个标记通过多层感知机(MLP)分别投影为头和尾表示,再与特定关系的权重矩阵进行双线性运算,计算成对关系得分。
  • 通过 LogSumExp 池化操作聚合属于同一实体对的所有提及对得分,生成每种关系类型的最终实体级预测。
  • 模型联合训练命名实体识别(NER)与关系抽取任务,通过共享上下文表示提升整体性能。
  • 在训练过程中引入来自额外语料库的弱标签数据,以增强泛化能力并减少对完全标注数据的依赖。
  • 在文档级别应用多实例学习,即只要文档中存在任意正样本提及对,即支持该实体对为正样本,从而缓解因缺失提及级标注带来的噪声。

实验结果

研究问题

  • RQ1一种能同时考虑完整摘要中所有提及对的神经网络模型,是否能优于仅关注孤立句级跨度的关系抽取模型?
  • RQ2在使用 BPE 分词的完整摘要上,自注意力机制在捕捉生物医学文本中的跨句关系方面效果如何?
  • RQ3在低资源关系抽取任务中,联合训练命名实体识别与关系抽取在多大程度上能提升性能?
  • RQ4在文档级别应用多实例学习,能否有效降低生物医学关系抽取中噪声或不完整提及级标注的影响?

主要发现

  • BRAN 模型在 Biocreative V CDR 数据集上取得 62.1% 的 F1 分数,成为无需外部知识库资源的最先进模型。
  • 该模型优于使用手工特征和语言资源的集成模型,表明端到端神经建模结合全上下文注意力可超越传统特征丰富的方法。
  • 消融研究显示,若移除 NER 监督,F1 分数将下降 7.0 个百分点(从 62.1% 降至 55.5%),凸显联合实体识别的重要性。
  • 使用额外弱监督数据可使 F1 从 62.1% 提升至 68.4%,表明弱监督能显著提升模型泛化能力。
  • 若移除宽度为 5 的卷积层,F1 降至 55.7%,表明局部卷积特征对性能有显著贡献。
  • 当使用更大的 BPE 词汇表(10,000)训练时,F1 达到 66.2%,而使用较小词汇表(2,500)时为 62.1%,表明词汇表大小影响性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。