[论文解读] Multimodal Machine Learning for Automated ICD Coding
本文提出了一种多模态机器学习框架,整合电子病历(EMR)中的非结构化文本、半结构化诊断信息和结构化表格数据,以更准确且可解释的方式预测ICD-10编码。通过结合模态特定的模型(Text-CNN、语义相似度建模和决策树)以及基于TF-IDF和LIME的证据检索,该方法实现了0.7633的micro-F1和0.9541的micro-AUC,显著优于TF-IDF和Text-CNN基线模型。
This study presents a multimodal machine learning model to predict ICD-10 diagnostic codes. We developed separate machine learning models that can handle data from different modalities, including unstructured text, semi-structured text and structured tabular data. We further employed an ensemble method to integrate all modality-specific models to generate ICD-10 codes. Key evidence was also extracted to make our prediction more convincing and explainable. We used the Medical Information Mart for Intensive Care III (MIMIC -III) dataset to validate our approach. For ICD code prediction, our best-performing model (micro-F1 = 0.7633, micro-AUC = 0.9541) significantly outperforms other baseline models including TF-IDF (micro-F1 = 0.6721, micro-AUC = 0.7879) and Text-CNN model (micro-F1 = 0.6569, micro-AUC = 0.9235). For interpretability, our approach achieves a Jaccard Similarity Coefficient (JSC) of 0.1806 on text data and 0.3105 on tabular data, where well-trained physicians achieve 0.2780 and 0.5002 respectively.
研究动机与目标
- 开发一个稳健的多模态机器学习系统,通过利用电子病历中的多样化数据类型,提升ICD-10编码预测的准确性。
- 通过多模态融合与领域感知特征工程,解决罕见ICD编码中的数据不平衡与低预测性能问题。
- 通过从非结构化文本和表格数据中提取临床相关证据,提升模型的可解释性,增强透明度与临床医生的信任。
- 在MIMIC-III数据集上验证模型性能,并与TF-IDF和Text-CNN等成熟基线模型进行对比。
- 证明将人类领域知识(如临床指南)融入机器学习可提升模型性能与临床相关性。
提出的方法
- 在非结构化临床记录上训练Text-CNN模型,用于多标签ICD编码分类。
- 构建深度学习模型,计算医生书写诊断与半结构化文本中ICD编码描述之间的语义相似度。
- 将数值型表格特征(如实验室检查结果、生命体征)转换为二值特征,并使用决策树对结构化数据进行ICD编码预测。
- 通过加权平均法融合三种模态特定模型的预测结果,以提升整体分类性能。
- 分别应用TF-IDF和LIME从文本和表格数据中提取关键证据,以增强模型可解释性。
- 引入基于临床指南的认知TF-IDF特征,以增强Text-CNN模型性能,尤其在罕见和复杂编码上表现更优。
实验结果
研究问题
- RQ1与单模态方法相比,整合电子病历中的多种数据模态(文本、半结构化、表格)是否能显著提升ICD-10编码预测的准确性?
- RQ2使用领域特定知识(如临床指南)在提升ICD编码机器学习性能方面有多有效?
- RQ3证据检索方法(TF-IDF与LIME)在多大程度上能提升自动化ICD编码预测的可解释性与临床可信度?
- RQ4多模态集成是否能缓解数据不平衡问题,特别是针对低频ICD编码?
- RQ5在相关性与一致性方面,模型的证据提取性能与人工标注的临床医生解释相比如何?
主要发现
- 集成模型实现了0.7633的micro-F1分数和0.9541的micro-AUC,显著优于TF-IDF(micro-F1: 0.6721, micro-AUC: 0.7879)和Text-CNN(micro-F1: 0.6569, micro-AUC: 0.9235)。
- 在文本数据上的可解释性性能达到0.1806的Jaccard相似度系数(JSC),与医生标注的0.2780相比,显示出与人工标注证据的高度一致性。
- 在表格数据上,模型的JSC达到0.3105,而医生为0.5002,表明在某些情况下,模型捕捉到比临床医生更多的相关特征。
- 将来自临床指南的认知TF-IDF特征整合后,模型性能得到提升,尤其在宏平均指标上表现更优,表明领域知识在临床NLP中的价值。
- 证据检索识别出临床相关术语,如E11.9编码下的“DM II”和“Metformin”,以及来自检验和处方数据的“Glucose”和“Insulin”,这些在仅文本分析中并不显著。
- 证据提取性能与分类AUC呈正相关:AUC较高的类别(如>0.9)产生的证据比AUC较低的类别(如D64.9的~0.7)更相关。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。