[论文解读] Cross-Modal Information Maximization for Medical Imaging: CMIM
本文提出CMIM,一种跨模态信息最大化框架,通过在训练过程中最大化多种医学影像模态(如X光、MRI、报告)之间的互信息,增强医学图像表征学习。该方法提升了模型在推理阶段面对模态缺失时的鲁棒性,在胸部X光分类和脑肿瘤分割任务中均优于最先进基线模型,尤其在使用较弱模态时表现更优。
In hospitals, data are siloed to specific information systems that make the same information available under different modalities such as the different medical imaging exams the patient undergoes (CT scans, MRI, PET, Ultrasound, etc.) and their associated radiology reports. This offers unique opportunities to obtain and use at train-time those multiple views of the same information that might not always be available at test-time. In this paper, we propose an innovative framework that makes the most of available data by learning good representations of a multi-modal input that are resilient to modality dropping at test-time, using recent advances in mutual information maximization. By maximizing cross-modal information at train time, we are able to outperform several state-of-the-art baselines in two different settings, medical image classification, and segmentation. In particular, our method is shown to have a strong impact on the inference-time performance of weaker modalities.
研究动机与目标
- 为解决现实医学影像中模态缺失的问题,即在测试时某些影像模态可能缺失。
- 通过跨不同影像模态的互信息最大化,提升多模态医学数据的表征学习能力。
- 通过在训练过程中确保所有模态间保留判别性特征,提升模型对较弱或信息量较少模态的鲁棒性与性能。
- 开发一种无需架构约束或模态特异性设计的通用框架,以实现更广泛地应用于各类医学影像任务。
提出的方法
- 该方法通过对比学习目标,训练深度神经网络以最大化不同模态(如CT、MRI、报告)的局部与全局表征之间的互信息。
- 采用双分支编码器结构:一个用于各模态的局部特征,一个用于各模态的全局特征,并共享一个多模态全局嵌入。
- 框架通过神经估计器(受Deep InfoMax和AM-DIM启发)估计互信息,以优化局部-局部和局部-全局对比损失。
- 在分类任务中,引入局部-全局互信息损失;在分割任务中,省略局部特征以优先保留空间上下文。
- 模型以端到端方式训练,结合任务特定损失(如分类或分割的交叉熵)与互信息损失。
- 设计为模块化且通用,可支持任意模态组合,无需共享权重或固定架构约束。
实验结果
研究问题
- RQ1在训练期间最大化跨模态互信息是否能提升模型在推理时某些模态缺失情况下的泛化能力与鲁棒性?
- RQ2多模态表征之间的互信息最大化如何影响医学图像分类与分割任务的性能?
- RQ3所提出的方法是否能增强较弱或信息量较少模态(如低信号MRI序列)在推理时的实用性?
- RQ4基于互信息的框架是否能在无需共享权重等架构约束的条件下,超越现有最先进多模态学习方法?
- RQ5当测试时仅能获取单一模态(尤其是性能较差的模态)时,CMIM在多大程度上提升了性能?
主要发现
- 在Open-I胸部X光分类任务中,CMIM优于TieNet与ResNet50,AUC更高,尤其在训练数据有限时表现更优。
- 该方法显著缓解了模态不平衡问题,即当报告稀疏时模型倾向于忽略影像数据,通过强制模态间互信息实现缓解。
- 在BRATS-2015分割任务中,CMIM实现了最先进性能,超越Hemis、Mean与MLP基线模型的所有指标。
- 模型在较弱模态(如FLAIR与T1W MRI序列)上表现出最强增益,证明了在判别信号较低时仍具备更强鲁棒性。
- 消融研究证实,局部-全局互信息损失在分类任务中提升了性能,而在分割任务中效果较弱,因全局特征更为关键。
- 结果验证了CMIM能有效保留各模态间的判别性信息,即使在测试时仅提供单一模态,也能实现强大推理性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。