Skip to main content
QUICK REVIEW

[论文解读] Multimodal Machine Learning for Automated ICD Coding

Keyang Xu, Mike Lam|arXiv (Cornell University)|Oct 31, 2018
Biomedical Text Mining and Ontologies参考文献 34被引用 8
一句话总结

本文提出了一种多模态机器学习框架,整合电子病历(EMR)中的非结构化文本、半结构化诊断信息和结构化表格数据,以更准确且可解释的方式预测ICD-10编码。通过结合模态特定的模型(Text-CNN、语义相似度建模和决策树)以及基于TF-IDF和LIME的证据检索,该方法实现了0.7633的micro-F1和0.9541的micro-AUC,显著优于TF-IDF和Text-CNN基线模型。

ABSTRACT

This study presents a multimodal machine learning model to predict ICD-10 diagnostic codes. We developed separate machine learning models that can handle data from different modalities, including unstructured text, semi-structured text and structured tabular data. We further employed an ensemble method to integrate all modality-specific models to generate ICD-10 codes. Key evidence was also extracted to make our prediction more convincing and explainable. We used the Medical Information Mart for Intensive Care III (MIMIC -III) dataset to validate our approach. For ICD code prediction, our best-performing model (micro-F1 = 0.7633, micro-AUC = 0.9541) significantly outperforms other baseline models including TF-IDF (micro-F1 = 0.6721, micro-AUC = 0.7879) and Text-CNN model (micro-F1 = 0.6569, micro-AUC = 0.9235). For interpretability, our approach achieves a Jaccard Similarity Coefficient (JSC) of 0.1806 on text data and 0.3105 on tabular data, where well-trained physicians achieve 0.2780 and 0.5002 respectively.

研究动机与目标

  • 开发一个稳健的多模态机器学习系统,通过利用电子病历中的多样化数据类型,提升ICD-10编码预测的准确性。
  • 通过多模态融合与领域感知特征工程,解决罕见ICD编码中的数据不平衡与低预测性能问题。
  • 通过从非结构化文本和表格数据中提取临床相关证据,提升模型的可解释性,增强透明度与临床医生的信任。
  • 在MIMIC-III数据集上验证模型性能,并与TF-IDF和Text-CNN等成熟基线模型进行对比。
  • 证明将人类领域知识(如临床指南)融入机器学习可提升模型性能与临床相关性。

提出的方法

  • 在非结构化临床记录上训练Text-CNN模型,用于多标签ICD编码分类。
  • 构建深度学习模型,计算医生书写诊断与半结构化文本中ICD编码描述之间的语义相似度。
  • 将数值型表格特征(如实验室检查结果、生命体征)转换为二值特征,并使用决策树对结构化数据进行ICD编码预测。
  • 通过加权平均法融合三种模态特定模型的预测结果,以提升整体分类性能。
  • 分别应用TF-IDF和LIME从文本和表格数据中提取关键证据,以增强模型可解释性。
  • 引入基于临床指南的认知TF-IDF特征,以增强Text-CNN模型性能,尤其在罕见和复杂编码上表现更优。

实验结果

研究问题

  • RQ1与单模态方法相比,整合电子病历中的多种数据模态(文本、半结构化、表格)是否能显著提升ICD-10编码预测的准确性?
  • RQ2使用领域特定知识(如临床指南)在提升ICD编码机器学习性能方面有多有效?
  • RQ3证据检索方法(TF-IDF与LIME)在多大程度上能提升自动化ICD编码预测的可解释性与临床可信度?
  • RQ4多模态集成是否能缓解数据不平衡问题,特别是针对低频ICD编码?
  • RQ5在相关性与一致性方面,模型的证据提取性能与人工标注的临床医生解释相比如何?

主要发现

  • 集成模型实现了0.7633的micro-F1分数和0.9541的micro-AUC,显著优于TF-IDF(micro-F1: 0.6721, micro-AUC: 0.7879)和Text-CNN(micro-F1: 0.6569, micro-AUC: 0.9235)。
  • 在文本数据上的可解释性性能达到0.1806的Jaccard相似度系数(JSC),与医生标注的0.2780相比,显示出与人工标注证据的高度一致性。
  • 在表格数据上,模型的JSC达到0.3105,而医生为0.5002,表明在某些情况下,模型捕捉到比临床医生更多的相关特征。
  • 将来自临床指南的认知TF-IDF特征整合后,模型性能得到提升,尤其在宏平均指标上表现更优,表明领域知识在临床NLP中的价值。
  • 证据检索识别出临床相关术语,如E11.9编码下的“DM II”和“Metformin”,以及来自检验和处方数据的“Glucose”和“Insulin”,这些在仅文本分析中并不显著。
  • 证据提取性能与分类AUC呈正相关:AUC较高的类别(如>0.9)产生的证据比AUC较低的类别(如D64.9的~0.7)更相关。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。