[论文解读] MedFuse: Multi-modal fusion with clinical time-series data and chest X-ray images
MedFuse 提出了一种基于LSTM的新型多模态融合框架,将临床时间序列和胸部X光片视为序列标记,从而在完全配对和部分配对数据上均表现出稳健性能。该方法在MIMIC-IV和MIMIC-CXR数据集上实现了住院死亡率预测和表型分类的最先进结果,且无需假设模态间相关性,也不需要在训练过程中使用全部模态。
Multi-modal fusion approaches aim to integrate information from different data sources. Unlike natural datasets, such as in audio-visual applications, where samples consist of "paired" modalities, data in healthcare is often collected asynchronously. Hence, requiring the presence of all modalities for a given sample is not realistic for clinical tasks and significantly limits the size of the dataset during training. In this paper, we propose MedFuse, a conceptually simple yet promising LSTM-based fusion module that can accommodate uni-modal as well as multi-modal input. We evaluate the fusion method and introduce new benchmark results for in-hospital mortality prediction and phenotype classification, using clinical time-series data in the MIMIC-IV dataset and corresponding chest X-ray images in MIMIC-CXR. Compared to more complex multi-modal fusion strategies, MedFuse provides a performance improvement by a large margin on the fully paired test set. It also remains robust across the partially paired test set containing samples with missing chest X-ray images. We release our code for reproducibility and to enable the evaluation of competing models in the future.
研究动机与目标
- 为解决多模态学习中异步、部分配对的临床数据挑战,设计一种在训练和推理过程中可处理缺失模态的融合模型。
- 利用公开的MIMIC-IV和MIMIC-CXR数据集,引入住院死亡率预测与表型分类的新基准结果。
- 发布可复现的数据预处理流程与代码库,以支持未来对多模态临床模型的评估。
- 开发一种对模态特定特征提取器无感的融合架构,并可扩展至两个以上模态。
- 证明在异质数据采集的临床环境中,联合融合优于早期和晚期融合策略。
提出的方法
- MedFuse将多模态表征建模为单模态嵌入(如时间序列和X光片特征)的序列,将其视为LSTM-based融合模块的输入标记。
- 融合模块利用LSTM的循环归纳偏置处理可变长度序列,通过将缺失输入视为空标记来处理缺失模态。
- 各模态的特征提取器相互独立,可采用任意深度学习架构,而融合模块对它们的内部设计保持无感。
- 模型通过标准交叉熵损失进行端到端训练,用于分类任务,且无需假设模态间相关性。
- 该方法在训练和推理过程中均支持完全配对和部分配对数据,提升了在真实临床数据上的泛化能力。
- 该框架设计可扩展至两个以上模态,且融合损失函数无需修改。
实验结果
研究问题
- RQ1当数据异步采集且部分配对时,基于LSTM的融合模块能否有效整合临床时间序列与胸部X光片?
- RQ2在真实世界异质数据的临床预测任务中,MedFuse是否优于标准的早期融合与联合融合基线?
- RQ3在推理过程中胸部X光片缺失时,该模型的表现如何,相较于要求所有模态的模型有何差异?
- RQ4MedFuse能否在不假设模态间相关性或要求配对数据的前提下实现最先进性能?
- RQ5在住院死亡率与表型分类任务中,多模态数据的引入在多大程度上提升了性能?
主要发现
- MedFuse在完全配对测试集上实现了住院死亡率预测的最先进性能,优于更复杂的多模态融合方法。
- 该模型在部分配对测试集上仍保持稳健性能,表明其在缺失胸部X光片的情况下具有强大泛化能力。
- 使用多模态输入可获得性能提升,且在两个基准任务上均显著优于单模态基线。
- 部分配对训练集的大小与性能增益之间无强相关性,表明模型能有效利用稀疏数据。
- 该方法在不假设临床时间序列与X光片特征之间存在任何相关性的前提下,表现出良好的模态泛化能力。
- 作者发布了可复现的MIMIC-IV和MIMIC-CXR代码库与预处理流程,为未来多模态临床模型的基准测试提供了支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。