[论文解读] MISS: A Generative Pretraining and Finetuning Approach for Med-VQA
本文提出 MISS,一种用于医学视觉问答(Med-VQA)的生成式预训练与微调框架,将 VQA 视为文本生成任务而非分类任务。通过将文本与多模态编码器统一为联合文本-多模态(JTM)编码器,并利用一种新颖的 Transfer-and-Caption 方法,借助大语言模型从无标注医学图像中生成合成图像-文本对,MISS 在仅使用少量标注多模态数据的情况下实现了最先进性能。
Medical visual question answering (VQA) is a challenging multimodal task, where Vision-Language Pre-training (VLP) models can effectively improve the generalization performance. However, most methods in the medical field treat VQA as an answer classification task which is difficult to transfer to practical application scenarios. Additionally, due to the privacy of medical images and the expensive annotation process, large-scale medical image-text pairs datasets for pretraining are severely lacking. In this paper, we propose a large-scale MultI-task Self-Supervised learning based framework (MISS) for medical VQA tasks. Unlike existing methods, we treat medical VQA as a generative task. We unify the text encoder and multimodal encoder and align image-text features through multi-task learning. Furthermore, we propose a Transfer-and-Caption method that extends the feature space of single-modal image datasets using Large Language Models (LLMs), enabling those traditional medical vision field task data to be applied to VLP. Experiments show that our method achieves excellent results with fewer multimodal datasets and demonstrates the advantages of generative VQA models.
研究动机与目标
- 解决用于预训练视觉语言模型的高质量大规模医学图像-文本对稀缺的问题。
- 克服现有 Med-VQA 模型将 VQA 视为答案分类所带来的局限性,从而限制其在现实世界中的部署。
- 通过利用大语言模型生成文本描述,实现利用单模态医学数据集(如分类或分割任务)进行有效预训练。
- 开发一种统一且高效的编码器架构,联合学习文本与多模态表征,以提升性能。
- 展示在医学影像应用中,生成式 VQA 相较于基于分类的方法具有优越性。
提出的方法
- 提出一种联合文本-多模态(JTM)编码器,将文本与多模态特征提取统一为单一共享编码器,提升效率并增强表征对齐。
- 引入一种名为 Transfer-and-Caption(TransCap)的方法,利用大语言模型(LLMs)从无标注的单模态医学图像中生成合成图像-文本对。
- 在预训练阶段采用多任务学习,结合图像-文本对比学习(ITC)、图像-文本匹配(ITM)和掩码语言建模(MLM)。
- 在微调阶段采用标准的解码器生成设置,联合特征与分词后的答案交互,以优化 MLM 损失。
- 利用现有的单模态数据集(如分类或分割任务中的数据)作为 TransCap 的输入,扩展有效预训练数据分布。
- 采用两阶段训练范式:先在合成与真实图像-文本对上进行预训练,再在下游 Med-VQA 基准上进行微调。
实验结果
研究问题
- RQ1将 Med-VQA 视为生成任务是否能相比基于分类的方法提升模型泛化能力与实际应用性?
- RQ2统一的 JTM 编码器是否能提升医学 VQA 中联合文本-多模态表征学习的效率与质量?
- RQ3通过大语言模型从单模态医学数据集中生成的合成图像-文本对,在多大程度上能提升预训练性能?
- RQ4当预训练数据有限时,MISS 表现如何,尤其与依赖稀缺真实多模态标注的模型相比?
- RQ5TransCap 方法是否能有效扩展单模态数据集的特征空间,以支持有效的视觉-语言预训练?
主要发现
- MISS 在 Med-VQA 基准上实现最先进性能,在仅使用 90,000 张预训练图像的情况下,SLAKE 数据集上的整体准确率达到 83.0%。
- 消融实验表明,移除 TransCap 会显著降低性能(在 SLAKE 上从 84.51% 降至 82.91%),证明其在数据扩展中的关键作用。
- 移除 JTM 编码器导致整体准确率从 84.51% 下降至 82.82%,证实其在联合表征学习中的有效性。
- 该模型优于现有基于分类的 Med-VQA 模型,尤其在开放式问题回答任务中表现更优,在 SLAKE 上达到 81.87% 的准确率。
- 即使在无任何预训练数据(0 张图像)的情况下,模型在 SLAKE 上仍能达到 50.99% 的准确率,表明 JTM 与 TransCap 组件具有强大的归纳偏置。
- 该方法在零样本和少样本设置下均表现出强泛化能力,凸显其在低数据医学 VQA 场景中的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。