[论文解读] Extracting UMLS Concepts from Medical Text Using General and Domain-Specific Deep Learning Models
本文提出了一种基于 BERT 的新型模型,通过拼接通用(BERT-base)和领域特定(NCBI BERT 或 bioBERT)的上下文嵌入,以提升医学文本中的 UMLS 概念识别效果。该方法在 i2b2 2010 数据集上实现了 0.90 的最先进 F1 分数,在更具挑战性的 MedMentions 数据集上设定了新的基准,F1 = 0.63,证明了显式结合通用知识与临床知识在实体识别中的优势。
Entity recognition is a critical first step to a number of clinical NLP applications, such as entity linking and relation extraction. We present the first attempt to apply state-of-the-art entity recognition approaches on a newly released dataset, MedMentions. This dataset contains over 4000 biomedical abstracts, annotated for UMLS semantic types. In comparison to existing datasets, MedMentions contains a far greater number of entity types, and thus represents a more challenging but realistic scenario in a real-world setting. We explore a number of relevant dimensions, including the use of contextual versus non-contextual word embeddings, general versus domain-specific unsupervised pre-training, and different deep learning architectures. We contrast our results against the well-known i2b2 2010 entity recognition dataset, and propose a new method to combine general and domain-specific information. While producing a state-of-the-art result for the i2b2 2010 task (F1 = 0.90), our results on MedMentions are significantly lower (F1 = 0.63), suggesting there is still plenty of opportunity for improvement on this new data.
研究动机与目标
- 评估最先进的深度学习模型在新发布的 MedMentions 数据集上的 UMLS 概念识别性能。
- 识别在研究较充分的数据集(如 i2b2 2010)与较少探索、更复杂的数据集(如 MedMentions)之间的性能差距。
- 研究上下文嵌入与非上下文嵌入、通用预训练与领域特定预训练,以及不同神经网络架构的影响。
- 提出并评估一种融合通用与临床知识的混合模型,以提升实体识别性能。
提出的方法
- 在 MedMentions 和 i2b2 数据集上微调通用 BERT-base 模型和领域特定 BERT 模型(NCBI BERT 或 bioBERT)。
- 对每个标记,拼接通用 BERT 模型和领域特定 BERT 模型的最终隐藏层表示。
- 将拼接后的嵌入输入线性分类器或 bi-LSTM 分类器层,用于序列标注。
- 在训练过程中联合微调两个 BERT 模型以及分类器层。
- 使用标注了所有 UMLS 语义类型的 MedMentions 数据集,评估在更广泛实体类型上的性能。
- 通过对比不同嵌入类型、架构和数据集的结果,分析性能差异。
实验结果
研究问题
- RQ1在不同数据集上,通用 BERT 模型与领域特定 BERT 模型在 UMLS 概念识别性能上如何比较?
- RQ2在临床文本的实体识别中,使用上下文嵌入与非上下文嵌入有何影响?
- RQ3通过模型拼接结合通用与领域特定知识,是否能提升在复杂、多类型实体识别任务上的性能?
- RQ4尽管模型架构相似,为何在 MedMentions 上的性能显著低于 i2b2 2010?
- RQ5考虑到其更高的复杂度和类别不平衡,bi-LSTM 分类器在 MedMentions 上是否优于线性分类器?
主要发现
- 所提出的拼接 BERT 模型在 i2b2 2010 数据集上实现了 0.90 的最先进 F1 分数,超越了此前最先进水平(0.89)。
- 在 MedMentions 数据集上,表现最佳的模型 F1 分数为 0.63,显著低于在 i2b2 2010 上的表现,凸显了该数据集的更高难度。
- 使用领域特定预训练(如 bioBERT 用于 MedMentions)比仅使用通用预训练效果更优。
- 将线性分类器替换为 bi-LSTM 在 MedMentions-st21pv 上提升了性能,但在 MedMentions-full 上反而导致结果下降,表明最优架构选择具有数据集特异性。
- 在所有数据集上,模型拼接均带来一致的小幅性能提升,表明显式融合通用与临床知识是未来研究的有前景方向。
- i2b2 与 MedMentions 之间的性能差距归因于 MedMentions 中实体类型更多、类别模糊性更高以及类别不平衡更严重。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。