Skip to main content
QUICK REVIEW

[论文解读] BERE: An accurate distantly supervised biomedical entity relation extraction network

Lixiang Hong, Jinjian Lin|arXiv (Cornell University)|Jun 17, 2019
Topic Modeling参考文献 32被引用 9
一句话总结

本文提出 BERE,一种用于远距离监督生物医学关系抽取的深度学习模型,通过 Gumbel Tree-GRU 捕获句子结构,并结合联合实体嵌入以增强关系分类。在 DDIExtraction 2013 和新构建的 DTIE 数据集上评估,BERE 达到了最先进的 F1 分数,并在 PR 曲线上表现更优,证明其在低资源设置下具备更高的准确性和鲁棒性。

ABSTRACT

Automated entity relation extraction (RE) from literature provides an important source for constructing biomedical database, which is more efficient and extensible than manual curation. However, existing RE models usually ignore the information contained in sentence structures and target entities. In this paper, we propose BERE, a deep learning based model which uses Gumbel Tree-GRU to learn sentence structures and joint embedding to incorporate entity information. It also employs word-level attention for improved relation extraction and sentence-level attention to suit the distantly supervised dataset. Because the existing dataset are relatively small, we further construct a much larger drug-target interaction extraction (DTIE) dataset by distant supervision. Experiments conducted on both DDIExtraction 2013 task and DTIE dataset show our model's effectiveness over state-of-the-art baselines in terms of F1 measures and PR curves.

研究动机与目标

  • 解决现有关系抽取模型在生物医学文本中未能充分利用句子结构和目标实体信息的局限性。
  • 提升远距离监督关系抽取的性能,其中弱监督导致训练信号噪声大且标注数据有限。
  • 利用远距离监督构建更大、更高质量的药物-靶点相互作用抽取(DTIE)数据集,以支持更稳健的模型训练与评估。
  • 开发一种能有效整合词级别与句子级别注意力机制的模型,以增强特征表示与关系分类性能。

提出的方法

  • 采用 Gumbel Tree-GRU 通过可微树操作学习依赖树,以建模分层的句子结构。
  • 整合实体对的联合嵌入,以丰富包含实体特定上下文与语义信息的表示。
  • 应用词级别注意力机制,聚焦于句子中与关系相关的关键词语,以提升特征选择效果。
  • 使用句子级别注意力机制,通过加权更信息丰富的句子来应对远距离监督数据中的固有噪声。
  • 在 DDIExtraction 2013 数据集与新构建的 DTIE 数据集上端到端训练模型,以提升泛化能力。
  • 利用远距离监督自动生成大规模训练数据,减少对昂贵人工标注的依赖。

实验结果

研究问题

  • RQ1能否通过联合编码句子结构与实体信息,使模型在远距离监督生物医学关系抽取中取得更优性能?
  • RQ2在低资源生物医学设置下,Gumbel Tree-GRU 在建模句法依赖关系方面相较于标准 RNN 或自注意力机制效果如何?
  • RQ3在噪声大、弱监督的数据集上,引入词级别与句子级别注意力在多大程度上能提升关系分类的准确性?
  • RQ4与现有基准数据集相比,新构建的 DTIE 数据集是否能实现更好的模型泛化与性能表现?

主要发现

  • BERE 在 DDIExtraction 2013 基准测试中达到最先进的 F1 分数,关系抽取准确率优于现有方法。
  • 模型在 PR 曲线上表现更优,表明在低资源、噪声环境中具备更优的精确率-召回率权衡。
  • Gumbel Tree-GRU 的集成显著提升了句法结构的建模能力,从而增强了关系分类性能。
  • 联合实体嵌入与多层级注意力机制能有效降低噪声,并提升远距离监督数据中的特征表示质量。
  • 新构建的 DTIE 数据集支持更稳健的训练与评估,促进模型在多样化生物医学关系上的泛化能力。
  • 实验结果证实,BERE 在训练数据有限的情况下仍能保持高性能,凸显其在低资源场景下的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。