Skip to main content
QUICK REVIEW

[论文解读] Deep Contextualized Biomedical Abbreviation Expansion

Qiao Jin, Liu Jin-ling|arXiv (Cornell University)|Jun 8, 2019
Biomedical Text Mining and Ontologies参考文献 20被引用 9
一句话总结

该论文提出 DECBAE,一种用于生物医学缩写扩展的深度上下文建模方法,利用 BioELMo 嵌入和缩写特异性双向 LSTMs 实现了最先进性能。它通过基于首次使用定义的启发式方法,从 PubMed 摘要中自动构建大规模训练数据集,准确率达到 96.1%,宏 F1 值为 91.7%,在临床缩写基准测试中优于基线模型和人类专家。

ABSTRACT

Automatic identification and expansion of ambiguous abbreviations are essential for biomedical natural language processing applications, such as information retrieval and question answering systems. In this paper, we present DEep Contextualized Biomedical. Abbreviation Expansion (DECBAE) model. DECBAE automatically collects substantial and relatively clean annotated contexts for 950 ambiguous abbreviations from PubMed abstracts using a simple heuristic. Then it utilizes BioELMo to extract the contextualized features of words, and feed those features to abbreviation-specific bidirectional LSTMs, where the hidden states of the ambiguous abbreviations are used to assign the exact definitions. Our DECBAE model outperforms other baselines by large margins, achieving average accuracy of 0.961 and macro-F1 of 0.917 on the dataset. It also surpasses human performance for expanding a sample abbreviation, and remains robust in imbalanced, low-resources and clinical settings.

研究动机与目标

  • 解决在未显式提供定义的上下文中歧义生物医学缩写的挑战。
  • 基于 PubMed 摘要中的首次使用定义,利用启发式方法自动构建大规模、高质量的缩写扩展训练数据集。
  • 开发一种鲁棒且低资源友好的模型,能够在包括临床文本在内的多样化生物医学场景中良好泛化。
  • 在高度模糊且标签分布不平衡的情况下,超越人类专家在缩写歧义消解中的表现。

提出的方法

  • 该模型使用启发式方法提取包含相同缩写的句子,并将首次出现的定义作为该缩写所有后续实例的标签。
  • 采用 BioELMo,一种在 1000 万篇 PubMed 摘要上预训练的生物医学领域自适应 ELMo 模型,生成上下文相关的词嵌入。
  • 针对每个缩写,在其上下文嵌入上训练独立的双向 LSTM 分类器,从候选定义集合中预测正确全称。
  • 在推理阶段,模型处理完整句子并使用对应缩写特异性的双向 LSTM 执行歧义消解。
  • 该方法通过使用固定的 BioELMo 嵌入和轻量级、任务特异性的双向 LSTM 头,避免微调 BERT,从而降低存储和推理开销。
  • 模型在多种设置下进行评估:随机、类别不平衡、低资源和临床场景,展现出良好的鲁棒性和泛化能力。

实验结果

研究问题

  • RQ1基于科学文本中首次使用定义的自监督数据收集方法,能否生成可靠且可扩展的生物医学缩写扩展训练数据集?
  • RQ2与非上下文或通用领域嵌入相比,BioELMo 嵌入在缩写歧义消解任务中能多大程度上提升性能?
  • RQ3在自动收集的数据上训练的缩写特异性双向 LSTM 分类器模型,是否能在复杂且模糊的生物医学缩写歧义消解中超越人类专家?
  • RQ4在低资源和类别不平衡设置下,所提出的模型表现有多稳健,尤其当某些定义类别远低于其他类别时?

主要发现

  • DECBAE 在主数据集上平均准确率达到 0.961,宏 F1 值为 0.917,显著优于所有基线模型。
  • 在类别不平衡设置下(多数类别占标签总数超过 95%),DECBAE 仍保持强劲性能,宏 F1 值为 0.898,而基线模型性能急剧下降。
  • 在临床子集上,该子集覆盖了先前临床研究中 85% 的缩写,DECBAE 尽管平均每个缩写有 8.5 个候选定义,仍表现出高精度。
  • 对于 'DAT' 的测试案例,DECBAE 在所有指标(包括准确率、宏 F1 和 Cohen’s kappa)上均优于单名人类专家。
  • 混淆矩阵分析表明,DECBAE 的错误更少,尤其在区分 'direct agglutination test' 和 'direct antiglobulin test' 时表现更优。
  • 即使仅使用 BioELMo 配合前馈网络的简化变体,也取得了尚可的性能,表明其在资源受限场景下具备实现更快推理的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。