Skip to main content
QUICK REVIEW

[论文解读] Biomedical Event Trigger Identification Using Bidirectional Recurrent Neural Network Based Models

P Rahul, Sunil Kumar Sahu|arXiv (Cornell University)|May 26, 2017
Biomedical Text Mining and Ontologies参考文献 14被引用 7
一句话总结

本文提出了一种基于双向RNN的生物医学事件触发词识别模型,通过利用词嵌入和实体类型嵌入,无需依赖复杂的手工特征。通过双向RNN捕捉长距离上下文依赖,并结合词级别与句子级别表征,该模型在MLEE语料库上实现了79.11的SOTA F1分数,显著优于先前的SVM、CNN和前馈神经网络基线模型,且具有统计显著性。

ABSTRACT

Biomedical events describe complex interactions between various biomedical entities. Event trigger is a word or a phrase which typically signifies the occurrence of an event. Event trigger identification is an important first step in all event extraction methods. However many of the current approaches either rely on complex hand-crafted features or consider features only within a window. In this paper we propose a method that takes the advantage of recurrent neural network (RNN) to extract higher level features present across the sentence. Thus hidden state representation of RNN along with word and entity type embedding as features avoid relying on the complex hand-crafted features generated using various NLP toolkits. Our experiments have shown to achieve state-of-art F1-score on Multi Level Event Extraction (MLEE) corpus. We have also performed category-wise analysis of the result and discussed the importance of various features in trigger identification task.

研究动机与目标

  • 为解决现有生物医学事件抽取流水线中触发词识别不准确的问题,该问题导致超过60%的错误率。
  • 通过利用深度学习实现端到端特征学习,减少对复杂且易出错的NLP工具包手工特征的依赖。
  • 通过循环神经网络架构捕捉整个句子的长距离上下文依赖,以提升性能。
  • 评估不同特征(词嵌入、实体类型嵌入和全局句子表征)对触发词识别准确率的贡献。

提出的方法

  • 使用双向门控循环单元(GRUs)编码完整句子上下文,捕捉超出局部窗口的长距离依赖。
  • 将预训练的词嵌入和随机初始化的实体类型嵌入作为每个标记的输入特征。
  • 将词嵌入与实体类型嵌入拼接,形成每个输入标记的单一密集特征向量。
  • 在最终分类中同时使用词级别特征(l)和RNN的句子级别隐藏状态(g)。
  • 使用交叉熵损失和随机梯度下降进行模型训练,优化触发词及其类型分类。
  • 通过消融实验评估模型变体,比较在有无实体类型嵌入以及局部与全局特征不同组合下的性能。

实验结果

研究问题

  • RQ1基于双向RNN的模型是否能通过捕捉更长范围的上下文,在生物医学触发词识别中超越基于窗口的模型?
  • RQ2词嵌入、实体类型嵌入和句子级别表征对性能提升的贡献如何?
  • RQ3消除手工特征是否能带来比传统SVM方法更好的泛化能力与更高的F1分数?
  • RQ4哪些触发词类别(如解剖学、分子、一般、计划类)对模型最具挑战性,原因是什么?
  • RQ5局部(词级别)与全局(句子级别)特征对分类准确率的相对影响如何?

主要发现

  • 所提出的GRU模型在MLEE语料库上实现了79.11的F1分数,显著优于所有基线模型,包括SVM、CNN和FFNN。
  • 该模型显著优于FFNN基线(p值 = 8.57×10⁻⁷)和CNNψ基线(p值 = 1.178×10⁻¹⁰),表明其具有统计上的优越性。
  • 模型在解剖学(F1: 85.87)和分子类(F1: 80.43)触发词类别上表现最佳,而在一般类(F1: 77.09)和计划类(F1: 67.43)类别上性能下降。
  • 引入实体类型嵌入(Eₑ)并同时使用局部与全局特征(l+g)使F1分数从76.52提升至79.11,证明了其关键作用。
  • 混淆矩阵显示,一般类与计划类中的“调节”子类型(如正向/负向调节)是假阳性和假阴性的主要来源。
  • 实例表明,缺乏实体类型信息的模型无法区分相同词语在不同语境下作为触发词或实体组成部分的角色,凸显Eₑ在消歧中的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。