[论文解读] Mimic-IV-ICD: A new benchmark for eXtreme MultiLabel Classification
本文介绍了 Mimic-IV-ICD,一个基于 MIMIC-IV 电子健康记录数据集的新开放基准,用于极端多标签 ICD 编码,支持 ICD-9 和 ICD-10 编码。该基准统一了数据预处理流程,评估了多种深度学习模型,并建立了可复现的基线模型,其中 MSMN 在低频编码组中表现优于 PLM-ICD,原因在于其对编码描述信息的更好整合。
Clinical notes are assigned ICD codes - sets of codes for diagnoses and procedures. In the recent years, predictive machine learning models have been built for automatic ICD coding. However, there is a lack of widely accepted benchmarks for automated ICD coding models based on large-scale public EHR data. This paper proposes a public benchmark suite for ICD-10 coding using a large EHR dataset derived from MIMIC-IV, the most recent public EHR dataset. We implement and compare several popular methods for ICD coding prediction tasks to standardize data preprocessing and establish a comprehensive ICD coding benchmark dataset. This approach fosters reproducibility and model comparison, accelerating progress toward employing automated ICD coding in future studies. Furthermore, we create a new ICD-9 benchmark using MIMIC-IV data, providing more data points and a higher number of ICD codes than MIMIC-III. Our open-source code offers easy access to data processing steps, benchmark creation, and experiment replication for those with MIMIC-IV access, providing insights, guidance, and protocols to efficiently develop ICD coding models.
研究动机与目标
- 为使用大规模公开 EHR 数据进行自动 ICD 编码缺乏广泛认可的基准这一问题提供解决方案。
- 对 MIMIC-IV 上的 ICD 编码任务,统一数据预处理和模型评估流程。
- 建立一个涵盖 ICD-9 和 ICD-10 编码的全面基准,其编码数量和数据点数量均超过以往基准。
- 通过发布开源代码,支持数据处理和实验复现,实现研究的可复现性,并促进模型比较。
- 通过提供一个标准化、公开可访问的基准,加速未来自动化 ICD 编码研究的发展。
提出的方法
- 作者对原始的 MIMIC-IV 临床笔记进行处理,并使用标准化流程将其映射到 ICD-9 和 ICD-10 编码。
- 实现并比较了多种深度学习模型,包括 PLM-ICD 和 MSMN,用于 ICD 编码预测。
- 该基准包含全编码和高频编码设置,使用编码频率组来评估模型在不同标签频率分布下的性能。
- 该方法整合了编码描述和同义词,以提升临床笔记与 ICD 编码之间的语义对齐,尤其在 MSMN 模型中表现显著。
- 发布了一个公开的开源代码库,支持研究人员在拥有 MIMIC-IV 访问权限的前提下,完成数据处理、基准构建和实验复现。
- 该流程同时支持 ICD-9 和 ICD-10 编码,其中 ICD-10 基准包含超过 155,000 个编码,显著扩展了 MIMIC-III 的规模。
实验结果
研究问题
- RQ1在使用 MIMIC-IV 数据进行极端多标签 ICD 编码任务时,不同深度学习模型的表现如何?
- RQ2整合编码描述和同义词对模型性能有何影响,特别是在罕见 ICD 编码上的表现?
- RQ3在 ICD-10 编码任务中,模型性能如何随不同编码频率组(如 1–10、11–50、51–100、>500)而变化?
- RQ4标准化的开放基准是否能提升可复现性,并加速自动化 ICD 编码研究的进展?
- RQ5与现有 MIMIC-III 基准相比,新的 MIMIC-IV-ICD 基准在数据量和编码覆盖范围方面有何差异?
主要发现
- MSMN 在 1–10、11–50 和 51–100 编码频率组中优于 PLM-ICD,尤其在宏平均 F1 分数上表现更优,原因在于其对编码描述和同义词的更好整合。
- 在 >500 编码组中,PLM-ICD 表现优于 MSMN,表明大型预训练语言模型在高频标签上的性能更优。
- >500 和 101–500 编码组中,MSMN 与 PLM-ICD 的宏平均 F1 差异为 1%,MSMN 在低频类别中表现更强。
- 该基准包含超过 155,000 个 ICD-10 编码,数据点数量超过 MIMIC-III,显著扩展了公开可用 ICD 编码数据的规模。
- 开源代码库支持数据处理和模型训练的完整可复现性,为未来模型改进和比较提供支持。
- 结果表明,将大型语言模型与结构化编码元数据(如描述、同义词)结合,可提升对罕见 ICD 编码的性能,预示着未来一个有前景的研究方向。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。