Skip to main content
QUICK REVIEW

[论文解读] KG-MTT-BERT: Knowledge Graph Enhanced BERT for Multi-Type Medical Text Classification

Yong He, Cheng Wang|arXiv (Cornell University)|Oct 8, 2022
Topic Modeling被引用 13
一句话总结

KG-MTT-BERT 提出了一种基于知识图谱增强的 BERT 模型,用于多类型医疗文本分类,特别针对诊断相关分组(DRG)预测。通过使用共享的 BERT 编码器处理不同类型的临床文本(如诊断、操作、住院过程),采用标记级编码和全局最大池化,并整合医学知识图谱,该模型在 DRG 分类任务中实现了最先进性能,准确率达到 91.79%,AUC 达到 93.10%,显著优于基线模型。

ABSTRACT

Medical text learning has recently emerged as a promising area to improve healthcare due to the wide adoption of electronic health record (EHR) systems. The complexity of the medical text such as diverse length, mixed text types, and full of medical jargon, poses a great challenge for developing effective deep learning models. BERT has presented state-of-the-art results in many NLP tasks, such as text classification and question answering. However, the standalone BERT model cannot deal with the complexity of the medical text, especially the lengthy clinical notes. Herein, we develop a new model called KG-MTT-BERT (Knowledge Graph Enhanced Multi-Type Text BERT) by extending the BERT model for long and multi-type text with the integration of the medical knowledge graph. Our model can outperform all baselines and other state-of-the-art models in diagnosis-related group (DRG) classification, which requires comprehensive medical text for accurate classification. We also demonstrated that our model can effectively handle multi-type text and the integration of medical knowledge graph can significantly improve the performance.

研究动机与目标

  • 为解决从电子健康记录(EHR)中对多类型、长篇幅且富含术语的医疗文本进行诊断相关分组(DRG)分类的挑战。
  • 克服 BERT 在处理长篇临床记录、多样化文本类型以及领域特定医学术语方面的局限性。
  • 通过将医学知识图谱集成到基于 BERT 的架构中,提升 DRG 分类性能。
  • 开发一种统一模型,有效编码并融合异构的临床文本输入与领域知识。

提出的方法

  • 对每类临床文本(如诊断、操作、住院过程)分别应用共享的 BERT 编码器,以保留输入模态的特异性。
  • 采用标记级编码而非文本级编码,以捕捉细粒度的语义表示,使 F1 指标提升超过 1.6 个百分点。
  • 在标记表示上应用全局最大池化,以突出对 DRG 分配至关重要的显著医学术语。
  • 整合医学知识图谱,将领域特定知识注入模型,增强对医学术语及其关系的理解。
  • 将不同文本类型池化后的表示拼接成统一的表示矩阵,用于分类。
  • 使用最终的分类层预测 DRG 类别,采用交叉熵损失进行端到端训练。

实验结果

研究问题

  • RQ1基于 BERT 的模型能否在文本长度和语义类型各异的情况下,有效将 EHR 中的多类型医疗文本分类为 DRG 类别?
  • RQ2在捕捉 DRG 分类相关医学信息方面,标记级编码是否优于文本级编码?
  • RQ3在临床文本分类任务中,整合医学知识图谱如何影响 BERT 的性能表现?
  • RQ4在 DRG 预测中,哪种池化策略——全局最大池化、平均池化或注意力池化——最能有效总结异构临床文本表示?
  • RQ5在医疗文本分类中,引入领域特定知识在多大程度上提升了泛化能力与准确性?

主要发现

  • KG-MTT-BERT 在 DRG-A 数据集上达到 91.79% 的准确率、89.61% 的 F1 值和 93.10% 的 AUC,显著优于所有基线模型和最先进模型。
  • 与文本级编码相比,标记级编码使 F1 指标提升超过 1.6 个百分点,证明了细粒度表示的优势。
  • 全局最大池化在所有池化策略中表现最佳,AUC 达到 0.8741,优于平均池化和注意力池化。
  • 医学知识图谱的引入使准确率提升 4.76 个百分点(从 87.03% 提升至 91.79%),AUC 提升 5.69 个百分点,证明其在领域适应中的关键作用。
  • 消融实验表明,知识图谱和标记级编码是影响最大的两个组件,其中知识图谱贡献了最大的性能增益。
  • 模型通过注意力机制成功识别出关键医学术语(如“stoma”、“anorectal”),其结果与临床相关性一致,支持模型可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。