Skip to main content
QUICK REVIEW

[论文解读] Multi-modal Pre-training for Medical Vision-language Understanding and Generation: An Empirical Study with A New Benchmark

Li Xu, Bo Liu|arXiv (Cornell University)|Jun 10, 2023
Multimodal Machine Learning Applications被引用 7
一句话总结

本文提出 RadioGraphy Captions (RGC),一个高质量、多模态的放射科数据集,包含 18,434 对图像-标题配对,旨在推进医学视觉-语言预训练(VLP)。利用 RGC 及其他数据集,作者对预训练因素——主干网络、目标函数和数据——进行了全面的实证研究,表明小规模但高质量的领域内数据优于更大规模但噪声较多的数据集,且预训练显著提升了在视觉问答(VQA)和检索等理解类任务上的性能,但在生成类任务上表现并不一致。

ABSTRACT

With the availability of large-scale, comprehensive, and general-purpose vision-language (VL) datasets such as MSCOCO, vision-language pre-training (VLP) has become an active area of research and proven to be effective for various VL tasks such as visual-question answering. However, studies on VLP in the medical domain have so far been scanty. To provide a comprehensive perspective on VLP for medical VL tasks, we conduct a thorough experimental analysis to study key factors that may affect the performance of VLP with a unified vision-language Transformer. To allow making sound and quick pre-training decisions, we propose RadioGraphy Captions (RGC), a high-quality, multi-modality radiographic dataset containing 18,434 image-caption pairs collected from an open-access online database MedPix. RGC can be used as a pre-training dataset or a new benchmark for medical report generation and medical image-text retrieval. By utilizing RGC and other available datasets for pre-training, we develop several key insights that can guide future medical VLP research and new strong baselines for various medical VL tasks.

研究动机与目标

  • 为解决医学视觉-语言(Med-VL)预训练中高质量、大规模数据集稀缺的问题。
  • 对医学 VLP 中的关键预训练因素——视觉主干网络、预训练目标和数据集选择——进行全面的实证研究。
  • 评估预训练视觉-语言 Transformer(VLT)在下游医学 VLP 任务(包括 VQA、报告生成和图文检索)中的有效性。
  • 为未来医学 VLP 研究提供强大且可复现的基线模型与可操作的洞见。
  • 确立 RGC 作为医学报告生成与图文检索任务的新基准。

提出的方法

  • 作者从开放获取的 MedPix 数据库中收集并筛选了 18,434 对图像-标题配对,构建了 RadioGraphy Captions(RGC)数据集,通过人工清洗确保数据质量。
  • 采用统一的视觉-语言 Transformer(VLT)框架,联合处理理解与生成任务,实现在不同任务间的一致性评估。
  • 在 RGC 和六个公开数据集(如 MIMIC-CXR、VQA-RAD)上进行预训练,通过消融实验研究视觉主干网络(ResNet、Swin Transformer)、预训练目标(如掩码语言建模)以及数据构成的影响。
  • 在三个下游任务上评估模型性能:Med-VQA(分类任务)、医学报告生成(序列生成)和图文检索(检索指标)。
  • 研究采用标准指标:VQA 使用准确率,报告生成使用 BLEU、ROUGE 和 BLEU-4,检索任务使用 Recall@K。
  • 所有源代码和预训练模型均已发布,以确保可复现性。

实验结果

研究问题

  • RQ1像 RGC 这样小规模但高质量的领域内医学 VL 数据集,是否在预训练中优于更大规模但噪声较多的数据集?
  • RQ2不同视觉主干网络(如 ResNet 与 Swin Transformer)在医学 VL 任务中的表现有何差异?
  • RQ3与分类和检索任务相比,预训练在医学报告生成任务上的性能提升程度如何?
  • RQ4哪种预训练目标和数据构成能实现跨多样化医学 VL 任务的最强泛化能力?
  • RQ5RGC 是否可作为评估医学视觉-语言模型在生成与检索任务中性能的可靠基准?

主要发现

  • 小规模但高质量的领域内数据集(RGC)在预训练中显著优于更大规模但噪声较多的数据集(如 MIMIC-CXR),表明数据质量与模态多样性比数据规模更为关键。
  • 预训练显著提升了在 Med-VQA 和图文检索任务中的性能,且 Swin Transformer 在所有任务中均持续优于 ResNet。
  • 在医学报告生成任务中,预训练并未提升性能,甚至在 IU X-Ray 数据集上导致性能下降,表明当前的预训练策略对复杂生成任务仍显不足。
  • 与单模态数据集(如 MIMIC-CXR)相比,RGC 作为基准更具有效性,因为它能揭示模型在不同影像模态间的性能差异。
  • 预训练的 VLT 模型在 VQA-RAD 和 SLAKE 上达到了最先进或具有竞争力的性能,验证了其作为强大基线的有效性。
  • 实证研究提供了可操作的洞见:数据质量与模态多样性至关重要,且预训练目标必须根据任务类型进行定制,尤其是对生成类任务。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。