Skip to main content
QUICK REVIEW

[论文解读] Fine-tuning BERT for Joint Entity and Relation Extraction in Chinese Medical Text

Kui Xue, Yangming Zhou|arXiv (Cornell University)|Aug 21, 2019
Topic Modeling参考文献 33被引用 14
一句话总结

该论文提出了一种聚焦注意力机制,通过任务特定的MASK矩阵在最后的BERT层中动态限制注意力范围,对BERT进行微调,以实现中文医学实体和关系的联合抽取。所提出的STR-编码器在冠状动脉造影文本上实现了SOTA性能,命名实体识别F1达到96.89%,关系分类F1达到88.51%,分别优于先前方法1.65%和1.22%。

ABSTRACT

Entity and relation extraction is the necessary step in structuring medical text. However, the feature extraction ability of the bidirectional long short term memory network in the existing model does not achieve the best effect. At the same time, the language model has achieved excellent results in more and more natural language processing tasks. In this paper, we present a focused attention model for the joint entity and relation extraction task. Our model integrates well-known BERT language model into joint learning through dynamic range attention mechanism, thus improving the feature representation ability of shared parameter layer. Experimental results on coronary angiography texts collected from Shuguang Hospital show that the F1-score of named entity recognition and relation classification tasks reach 96.89% and 88.51%, which are better than state-of-the-art methods 1.65% and 1.22%, respectively.

研究动机与目标

  • 解决基于Bi-LSTM的联合模型在捕捉中文医学文本中实体类型与关系类型之间共享特征方面的局限性。
  • 通过将BERT的预训练知识整合到共享参数层中,改进联合学习中的特征表示。
  • 设计一种动态注意力机制,使BERT的上下文学习聚焦于NER和RC任务相关的标记。
  • 评估联合学习与流水线方法在中文医学文本抽取中的有效性。
  • 分析超参数敏感性及消融实验对模型性能的影响。

提出的方法

  • 引入一种共享任务表征编码器(STR-编码器),通过修改BERT最后K层的注意力机制,使其聚焦于任务特定的输入片段。
  • 为关系分类使用两个不同的MASK矩阵:一个限制注意力范围至两个实体,另一个允许更广泛的上下文。
  • 采用动态范围注意力机制,控制BERT自注意力机制中的注意力范围,实现任务特定的上下文表征。
  • 将STR-编码器作为共享特征提取器,应用于NER和RC的联合学习框架中。
  • 使用交叉熵损失对NER(BIEOS标注)和RC(分类)进行端到端联合训练。
  • 通过分别训练NER和RC进行消融研究,以隔离联合学习带来的收益。

实验结果

研究问题

  • RQ1基于BERT的共享编码器结合动态注意力机制是否能提升中文医学文本中联合实体与关系抽取的性能?
  • RQ2MASK矩阵的选择如何影响所提出模型的关系分类性能?
  • RQ3在最大性能下,应选择BERT的多少层(K)来应用聚焦注意力机制?
  • RQ4NER与RC的联合学习是否优于分别训练这两个任务?
  • RQ5超参数K与MASK配置如何相互作用,进而影响模型性能?

主要发现

  • 所提模型在命名实体识别上达到96.89%的F1,比之前SOTA高出1.65个百分点。
  • 模型在关系分类上达到88.51%的F1,比第二好的方法高出1.22个百分点。
  • 当K=6且MASK rc使用公式(13)时,NER的F1达到最高值96.77%,表明更广的注意力范围有助于实体识别。
  • 对于关系分类,当K=4且MASK rc使用公式(14)时,F1达到最高值92.18%,表明受限注意力有助于RC任务。
  • 与单独训练相比,联合学习使NER和RC的F1分别提升0.52和0.82个百分点。
  • 消融分析证实,联合学习能够捕捉有益的跨任务特征,尽管由于引入噪声,实体类型预测的精确率略有下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。