[论文解读] Multi-task Paired Masking with Alignment Modeling for Medical Vision-Language Pre-training
本文提出了一种统一的医学视觉-语言预训练框架——多任务配对掩码对齐(Multi-task Paired Masking with Alignment, MPMA),通过将跨模态对齐整合到联合图像-文本重建中,增强多模态交互。通过引入全局与局部对齐(Global and Local Alignment, GLA)模块以及记忆增强型跨模态融合(Memory-Augmented Cross-Modal Fusion, MA-CMF)模块,该方法在单模态、跨模态和多模态下游任务中均实现了最先进性能,即使在低样本监督设置下亦表现优异。
In recent years, the growing demand for medical imaging diagnosis has placed a significant burden on radiologists. As a solution, Medical Vision-Language Pre-training (Med-VLP) methods have been proposed to learn universal representations from medical images and reports, benefiting downstream tasks without requiring fine-grained annotations. However, existing methods have overlooked the importance of cross-modal alignment in joint image-text reconstruction, resulting in insufficient cross-modal interaction. To address this limitation, we propose a unified Med-VLP framework based on Multi-task Paired Masking with Alignment (MPMA) to integrate the cross-modal alignment task into the joint image-text reconstruction framework to achieve more comprehensive cross-modal interaction, while a Global and Local Alignment (GLA) module is designed to assist self-supervised paradigm in obtaining semantic representations with rich domain knowledge. Furthermore, we introduce a Memory-Augmented Cross-Modal Fusion (MA-CMF) module to fully integrate visual information to assist report reconstruction and fuse the multi-modal representations adequately. Experimental results demonstrate that the proposed unified approach outperforms previous methods in all downstream tasks, including uni-modal, cross-modal, and multi-modal tasks.
研究动机与目标
- 解决现有医学视觉-语言预训练(Med-VLP)方法中跨模态交互有限的问题,这些方法在联合图像-文本重建过程中常忽略对齐过程。
- 克服现有基于重建的方法中视觉与文本特征融合较弱的问题,尤其是使用简单池化操作(如全局平均池化GAP或全局最大池化GMP)的局限。
- 通过将跨模态对齐作为多任务目标整合,增强自监督表示学习,以引入领域特定知识,丰富语义表示。
- 设计一种鲁棒的融合机制,充分利用视觉特征以提升报告重建性能,尤其在低资源设置下表现更优。
- 在仅使用极少标注数据的情况下,验证所提框架在多样化下游医学视觉-语言任务中的泛化性与鲁棒性。
提出的方法
- 提出多任务配对掩码对齐(MPMA),一种统一的医学视觉-语言预训练(Med-VLP)框架,联合优化图像-文本重建与跨模态对齐。
- 引入全局与局部对齐(GLA)模块,显式建模图像与文本在全局和局部层面的对应关系,提升自监督预训练过程中的语义对齐能力。
- 设计记忆增强型跨模态融合(MA-CMF)模块,通过存储与检索模态特异性模式,实现更有效的视觉与文本特征融合。
- 采用配对掩码策略:同时对图像中的图像块与报告中的词元进行掩码,实现联合重建,同时保持模态特异性不变性。
- 使用结合图像重建、文本重建与对齐损失的多任务损失函数进行优化,并引入可学习的权重系数。
- 采用基于Transformer的编码器-解码器架构,通过交叉注意力机制促进重建与对齐过程中图像与文本模态之间的交互。
实验结果
研究问题
- RQ1将跨模态对齐作为多任务目标整合,是否能提升医学视觉-语言预训练中自监督表示的质量?
- RQ2与标准池化方法(如GAP或GMP)相比,所提出的MA-CMF模块在视觉与文本特征融合方面有何提升?
- RQ3在缺乏显式标注的情况下,GLA模块在多大程度上提升了图像与报告表示之间的对齐能力?
- RQ4在仅使用少量标注图像-文本对的低样本微调设置下,所提框架的鲁棒性如何?
- RQ5在多任务训练目标中,重建损失与对齐损失之间应如何实现最优平衡?
主要发现
- 所提出的MPMA框架在六个公开医学视觉-语言基准上均达到最先进性能,涵盖图像分类、报告生成与视觉问答等任务。
- 在CheXpert数据集上,当λ_IL = 5且λ_gl = 1时,模型AUC达到90.6,最优性能出现在λ_IL = 5且λ_gl = 3时。
- MA-CMF模块显著优于GAP与GMP,尤其在低标注比例(如1%)下表现更优,体现出在低资源场景下的鲁棒性。
- 消融实验表明,若移除MA-CMF中的记忆组件,性能会下降,证明记忆机制显著提升了融合质量。
- 敏感性分析显示,若λ_gl设置过高(如5),性能反而受损,表明对齐损失应与重建损失谨慎平衡。
- 即使仅使用1%的标注数据,模型在所有下游任务中仍保持稳定性能,凸显其数据效率与泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。