Skip to main content
QUICK REVIEW

[论文解读] AliFuse: Aligning and Fusing Multi-modal Medical Data for Computer-Aided Diagnosis

Qiuhui Chen, Yi Hong|arXiv (Cornell University)|Jan 2, 2024
Multimodal Machine Learning Applications被引用 4
一句话总结

本文提出AliFuse,一种基于Transformer的视觉-语言模型,用于对多模态医学数据(特别是MRI扫描和非影像临床数据,如人口统计学信息、实验室检查结果和临床摘要)进行对齐与融合,以提升阿尔茨海默病(Alzheimer’s disease, AD)的诊断性能。通过利用对比学习实现跨模态对齐,结合交叉注意力机制实现特征融合,AliFuse在五个公开的AD数据集上实现了最先进(SOTA)的性能,相较于仅使用图像的模型,准确率提升超过13%。

ABSTRACT

Medical data collected for diagnostic decisions are typically multimodal, providing comprehensive information on a subject. While computer-aided diagnosis systems can benefit from multimodal inputs, effectively fusing such data remains a challenging task and a key focus in medical research. In this paper, we propose a transformer-based framework, called Alifuse, for aligning and fusing multimodal medical data. Specifically, we convert medical images and both unstructured and structured clinical records into vision and language tokens, employing intramodal and intermodal attention mechanisms to learn unified representations of all imaging and non-imaging data for classification. Additionally, we integrate restoration modeling with contrastive learning frameworks, jointly learning the high-level semantic alignment between images and texts and the low-level understanding of one modality with the help of another. We apply Alifuse to classify Alzheimer's disease, achieving state-of-the-art performance on five public datasets and outperforming eight baselines.

研究动机与目标

  • 为解决有效融合多模态医学数据(尤其是影像与非影像临床数据)以提升计算机辅助诊断性能的挑战。
  • 开发一种统一框架,将视觉与语言表征对齐至共享空间,以实现稳健、整体的诊断分类。
  • 通过整合结构化MRI、人口统计学信息、实验室检查结果和临床叙述等多种数据类型,提升阿尔茨海默病分类的诊断性能。
  • 通过引入专门的损失函数,更有效地处理文本中的数值信息,增强模型对临床数值(如实验室值和年龄)的敏感性。

提出的方法

  • 将医学影像和非影像文本数据转换为视觉和语言标记,以在基于Transformer的架构中联合处理。
  • 使用图文对比学习,将视觉与文本嵌入对齐至共享表征空间,增强跨模态理解能力。
  • 在图像与文本标记之间实施交叉注意力机制,实现在分类过程中动态、上下文感知的特征融合。
  • 引入专门的数值损失($L_{\text{num}}$),以提升模型对文本中临床数值(如实验室值和年龄)的敏感性。
  • 在五个大型公开AD数据集(ADNI、NACC、OASIS、AIBL、MIRIAD)上端到端训练模型,使用原始MRI体积和非结构化/结构化临床数据。
  • 利用预训练的视觉编码器和微调后的文本编码器,提取并对齐多模态特征,再进行分类。

实验结果

研究问题

  • RQ1统一的视觉-语言模型能否有效对齐并融合多模态医学数据(包括MRI扫描和非影像临床数据),以提升阿尔茨海默病的诊断性能?
  • RQ2与简单的特征拼接或晚期融合相比,通过对比学习实现显式跨模态对齐对诊断性能的影响如何?
  • RQ3不同非影像数据类型(如人口统计学信息、实验室检查结果、临床摘要)对阿尔茨海默病分类诊断准确率的相对贡献是什么?
  • RQ4针对文本中数值的专用损失在多大程度上提升了模型在临床数据上的性能?
  • RQ5模型的注意力机制在图像和文本中是否聚焦于临床上相关的特征?

主要发现

  • AliFuse在五个公开的阿尔茨海默病数据集上实现了最先进性能,在ADNI数据集上测试准确率达到87.93%,显著优于仅使用图像的基线模型,准确率提升超过13个百分点。
  • 与仅使用文本的基线相比,模型准确率提升超过6%,且在ADNI数据集上超越最先进方法Irene超过4%。
  • 非影像数据的引入,尤其是实验室检查结果,对性能贡献最大,仅实验室结果一项即使准确率相比移除所有非影像数据提升超过3%。
  • 消融实验表明,对齐损失与数值损失($L_{\text{num}}$)均至关重要,其中后者单独即可带来超过3%的准确率增益。
  • 注意力可视化显示,AliFuse聚焦于临床上相关的特征:在图像中关注脑室、皮层等结构,在文本中关注'MMSE'、'CDR'、'逻辑记忆'和'女性'等关键临床术语。
  • t-SNE可视化结果表明,对齐的多模态特征相比单模态或未对齐的多模态表征,能实现更好的类别分离,NC、MCI和AD组呈现出清晰的聚类。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。