Skip to main content
QUICK REVIEW

[论文解读] Extracting UMLS Concepts from Medical Text Using General and Domain-Specific Deep Learning Models

Kathleen Fraser, Isar Nejadgholi|arXiv (Cornell University)|Oct 3, 2019
Topic Modeling参考文献 31被引用 15
一句话总结

本文提出了一种基于 BERT 的新型模型,通过拼接通用(BERT-base)和领域特定(NCBI BERT 或 bioBERT)的上下文嵌入,以提升医学文本中的 UMLS 概念识别效果。该方法在 i2b2 2010 数据集上实现了 0.90 的最先进 F1 分数,在更具挑战性的 MedMentions 数据集上设定了新的基准,F1 = 0.63,证明了显式结合通用知识与临床知识在实体识别中的优势。

ABSTRACT

Entity recognition is a critical first step to a number of clinical NLP applications, such as entity linking and relation extraction. We present the first attempt to apply state-of-the-art entity recognition approaches on a newly released dataset, MedMentions. This dataset contains over 4000 biomedical abstracts, annotated for UMLS semantic types. In comparison to existing datasets, MedMentions contains a far greater number of entity types, and thus represents a more challenging but realistic scenario in a real-world setting. We explore a number of relevant dimensions, including the use of contextual versus non-contextual word embeddings, general versus domain-specific unsupervised pre-training, and different deep learning architectures. We contrast our results against the well-known i2b2 2010 entity recognition dataset, and propose a new method to combine general and domain-specific information. While producing a state-of-the-art result for the i2b2 2010 task (F1 = 0.90), our results on MedMentions are significantly lower (F1 = 0.63), suggesting there is still plenty of opportunity for improvement on this new data.

研究动机与目标

  • 评估最先进的深度学习模型在新发布的 MedMentions 数据集上的 UMLS 概念识别性能。
  • 识别在研究较充分的数据集(如 i2b2 2010)与较少探索、更复杂的数据集(如 MedMentions)之间的性能差距。
  • 研究上下文嵌入与非上下文嵌入、通用预训练与领域特定预训练,以及不同神经网络架构的影响。
  • 提出并评估一种融合通用与临床知识的混合模型,以提升实体识别性能。

提出的方法

  • 在 MedMentions 和 i2b2 数据集上微调通用 BERT-base 模型和领域特定 BERT 模型(NCBI BERT 或 bioBERT)。
  • 对每个标记,拼接通用 BERT 模型和领域特定 BERT 模型的最终隐藏层表示。
  • 将拼接后的嵌入输入线性分类器或 bi-LSTM 分类器层,用于序列标注。
  • 在训练过程中联合微调两个 BERT 模型以及分类器层。
  • 使用标注了所有 UMLS 语义类型的 MedMentions 数据集,评估在更广泛实体类型上的性能。
  • 通过对比不同嵌入类型、架构和数据集的结果,分析性能差异。

实验结果

研究问题

  • RQ1在不同数据集上,通用 BERT 模型与领域特定 BERT 模型在 UMLS 概念识别性能上如何比较?
  • RQ2在临床文本的实体识别中,使用上下文嵌入与非上下文嵌入有何影响?
  • RQ3通过模型拼接结合通用与领域特定知识,是否能提升在复杂、多类型实体识别任务上的性能?
  • RQ4尽管模型架构相似,为何在 MedMentions 上的性能显著低于 i2b2 2010?
  • RQ5考虑到其更高的复杂度和类别不平衡,bi-LSTM 分类器在 MedMentions 上是否优于线性分类器?

主要发现

  • 所提出的拼接 BERT 模型在 i2b2 2010 数据集上实现了 0.90 的最先进 F1 分数,超越了此前最先进水平(0.89)。
  • 在 MedMentions 数据集上,表现最佳的模型 F1 分数为 0.63,显著低于在 i2b2 2010 上的表现,凸显了该数据集的更高难度。
  • 使用领域特定预训练(如 bioBERT 用于 MedMentions)比仅使用通用预训练效果更优。
  • 将线性分类器替换为 bi-LSTM 在 MedMentions-st21pv 上提升了性能,但在 MedMentions-full 上反而导致结果下降,表明最优架构选择具有数据集特异性。
  • 在所有数据集上,模型拼接均带来一致的小幅性能提升,表明显式融合通用与临床知识是未来研究的有前景方向。
  • i2b2 与 MedMentions 之间的性能差距归因于 MedMentions 中实体类型更多、类别模糊性更高以及类别不平衡更严重。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。