[论文解读] Self-supervised vision-language pretraining for Medical visual question answering
本文提出了一种用于医学视觉问答(VQA)的自监督视觉-语言预训练方法 M2I2,该方法联合优化了掩码图像建模、掩码语言建模、图文匹配以及医学图像字幕上的对比对齐。该方法在三个公开的医学 VQA 基准上实现了最先进性能,证明了在标注数据有限的情况下具有更强的泛化能力。
Medical image visual question answering (VQA) is a task to answer clinical questions, given a radiographic image, which is a challenging problem that requires a model to integrate both vision and language information. To solve medical VQA problems with a limited number of training data, pretrain-finetune paradigm is widely used to improve the model generalization. In this paper, we propose a self-supervised method that applies Masked image modeling, Masked language modeling, Image text matching and Image text alignment via contrastive learning (M2I2) for pretraining on medical image caption dataset, and finetunes to downstream medical VQA tasks. The proposed method achieves state-of-the-art performance on all the three public medical VQA datasets. Our codes and models are available at https://github.com/pengfeiliHEU/M2I2.
研究动机与目标
- 为解决医学视觉问答(VQA)中标注数据有限的挑战,通过提升模型泛化能力来应对。
- 开发一种自监督预训练框架,以有效对齐医学影像中的视觉与语言表征。
- 通过在医学图像字幕数据上联合优化多种预训练目标,提升下游医学 VQA 性能。
- 通过最小化对人工标注 VQA 对对的依赖,建立医学 VQA 的强基线模型,采用预训练-微调范式。
提出的方法
- 该方法在预训练阶段使用掩码图像建模(MIM)来重建医学图像中被损坏的图像块。
- 它应用掩码语言建模(MLM)来重建临床问题和答案描述中的掩码标记。
- 图文匹配(ITM)用于预测给定的图像与文本对是否为正样本或负样本。
- 对比学习(CL)通过最大化正样本对之间的一致性并最小化负样本对之间的一致性,来对齐图像和文本嵌入。
- 四种目标——MIM、MLM、ITM 和 CL——在医学图像字幕数据集上被统一整合到 M2I2 框架中进行联合优化。
- 预训练模型在下游医学 VQA 数据集上进行微调,仅需极少的适应调整。
实验结果
研究问题
- RQ1在标注数据有限的情况下,通过多种对比学习与掩码建模目标进行自监督预训练,是否能提升医学 VQA 的性能?
- RQ2联合优化视觉-语言目标(MIM、MLM、ITM、CL)在学习医学 VQA 通用表征方面的有效性如何?
- RQ3所提出的 M2I2 框架是否在标准医学 VQA 基准上优于现有的视觉-语言预训练方法?
- RQ4在医学图像字幕上进行预训练,在多大程度上能泛化到下游 VQA 任务?
主要发现
- M2I2 方法在本研究评估的三个公开医学 VQA 基准上均实现了最先进性能。
- 由于有效的自监督预训练,该模型在低数据场景下相比现有方法表现出显著提升。
- 消融实验证实,所有四种预训练目标(MIM、MLM、ITM、CL)均对最终 VQA 性能有积极贡献。
- 该模型能很好地泛化到多种临床问题类型,表明其具备稳健的视觉-语言理解能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。