[论文解读] A Comparison of Pre-trained Vision-and-Language Models for Multimodal Representation Learning across Medical Images and Reports
本研究评估了四种预训练视觉-语言(V+L)模型——LXMERT、VisualBERT、UNITER 和 PixelBERT——在从胸部X光片和放射科报告中学习联合图像-文本表征方面的表现。结果表明,这些模型在胸腔异常分类任务中显著优于CNN-RNN基线模型,消融实验进一步证实了联合嵌入和预训练的优势,而非仅依赖文本或随机权重的模型。
Joint image-text embedding extracted from medical images and associated contextual reports is the bedrock for most biomedical vision-and-language (V+L) tasks, including medical visual question answering, clinical image-text retrieval, clinical report auto-generation. In this study, we adopt four pre-trained V+L models: LXMERT, VisualBERT, UNIER and PixelBERT to learn multimodal representation from MIMIC-CXR radiographs and associated reports. The extrinsic evaluation on OpenI dataset shows that in comparison to the pioneering CNN-RNN model, the joint embedding learned by pre-trained V+L models demonstrate performance improvement in the thoracic findings classification task. We conduct an ablation study to analyze the contribution of certain model components and validate the advantage of joint embedding over text-only embedding. We also visualize attention maps to illustrate the attention mechanism of V+L models.
研究动机与目标
- 评估四种预训练视觉-语言模型在从医学图像与报告中学习联合图像-文本表征方面的性能。
- 比较预训练V+L模型与传统CNN-RNN基线模型(TieNet)在多标签胸腔异常分类任务中的有效性。
- 通过消融实验分析联合图像-文本嵌入与仅文本嵌入的贡献差异。
- 探究在生物医学领域中,预训练与从随机权重训练相比对模型性能的影响。
- 通过注意力图与模态重要性评分,可视化注意力机制,以理解V+L模型中模态间的交互作用。
提出的方法
- 在MIMIC-CXR数据集上微调四种预训练的V+L模型(LXMERT、VisualBERT、UNITER 和 PixelBERT),以实现联合图像-文本表征学习。
- 在[CLS]标记上添加多标签分类头,用于从配对的X光片图像和放射科报告中预测13种胸腔异常。
- 对数据进行预处理,仅保留每份报告对应的第一张前后位X光片,并将标签从四分类重新归类为二分类(阳性/阴性)。
- 通过消融实验比较联合图像-文本嵌入、仅文本嵌入与随机权重模型,以隔离联合学习的贡献。
- 对表现最佳的模型(VisualBERT)在不同网络层可视化注意力图,以分析模态间交互与注意力模式。
- 计算各层的模态重要性(MI)得分,以定量评估视觉与文本模态的相对注意力贡献。

实验结果
研究问题
- RQ1预训练的视觉-语言模型在学习胸腔异常分类的联合表征方面,与CNN-RNN基线模型相比表现如何?
- RQ2在医学V+L任务中,联合图像-文本嵌入与仅文本嵌入的相对贡献是什么?
- RQ3在生物医学领域中,预训练是否相较于从随机权重开始训练具有显著的性能优势?
- RQ4V+L模型中,注意力机制在不同层上如何在视觉与文本模态之间分配?
- RQ5V+L模型在医学图像-文本分类中的失败模式是什么?子词分词与报告截断如何影响预测结果?
主要发现
- 预训练的V+L模型在OpenI数据集上显著优于CNN-RNN基线模型(TieNet),胸腔异常分类的平均F1得分提升了15%。
- 消融实验表明,联合图像-文本嵌入始终优于仅文本嵌入,证明了多模态融合的价值。
- 与从随机权重训练相比,预训练显著提升了模型性能,凸显了大规模预训练数据的重要性。
- 在四种模型中,VisualBERT表现最佳,在OpenI测试集上的平均F1得分为0.54。
- 逐层模态重要性(MI)得分显示,文本模态在中间层获得了显著高于视觉模态的注意力,尤其是在中间层。
- 错误分析发现,子词分词(如WordPiece)可能导致假阳性结果,当罕见术语如‘hydropneumothorax’被拆分为子词时,其子词可能与更常见的术语如‘pneumothorax’匹配。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。