Skip to main content
QUICK REVIEW

[论文解读] Are Natural Domain Foundation Models Useful for Medical Image Classification?

Joana Palés Huix, Ganeshan, Adithya Raju|arXiv (Cornell University)|Oct 30, 2023
COVID-19 diagnosis using AI被引用 4
一句话总结

本研究评估了五种最先进的基础模型——DINOv2、CLIP、BLIP、SAM 和 SEE-MS——在四个基准数据集上的医学图像分类表现。DINOv2 在所有数据集中持续优于 ImageNet-1k 监督预训练基线,而其他模型则未能超越该基线,表明尽管在自然视觉领域表现优异,但并非所有基础模型都能有效泛化到医学影像任务中。

ABSTRACT

The deep learning field is converging towards the use of general foundation models that can be easily adapted for diverse tasks. While this paradigm shift has become common practice within the field of natural language processing, progress has been slower in computer vision. In this paper we attempt to address this issue by investigating the transferability of various state-of-the-art foundation models to medical image classification tasks. Specifically, we evaluate the performance of five foundation models, namely SAM, SEEM, DINOv2, BLIP, and OpenCLIP across four well-established medical imaging datasets. We explore different training settings to fully harness the potential of these models. Our study shows mixed results. DINOv2 consistently outperforms the standard practice of ImageNet pretraining. However, other foundation models failed to consistently beat this established baseline indicating limitations in their transferability to medical image classification tasks.

研究动机与目标

  • 评估自然领域基础模型在医学图像分类任务中的可迁移性。
  • 比较自监督与对比学习预训练模型(如 DINOv2、CLIP、BLIP)与标准 ImageNet-1k 监督基线的性能表现。
  • 探究在医学数据集上,微调或冻结主干网络是否能提升性能。
  • 分析在医学微调过程中,基础模型各层的特征重用与适应情况。
  • 确定架构设计或预训练目标是否影响医学影像中的迁移成功。

提出的方法

  • 在四个医学影像数据集(ISIC、ChestX-ray14、NIH 和 Chexpert)上评估了五种基础模型:DINOv2、CLIP(OpenCLIP)、BLIP、SAM 和 SEE-MS。
  • 采用线性头和 ViT 基分类器头,以评估不同适应策略下的性能表现。
  • 执行全量微调和部分微调(冻结或解冻特定层),以分析特征适应情况。
  • 应用 k-NN 评估以在无需任务特定适应的情况下评估特征质量与可迁移性。
  • 通过激活图进行特征相似性分析,比较不同模型与数据集之间的表征差异。
  • 使用高分辨率输入并改变数据集规模,以评估数据量与分辨率敏感性。

实验结果

研究问题

  • RQ1在自然图像数据上预训练的基础模型是否能在医学图像分类中超越标准的 ImageNet-1k 监督预训练基线?
  • RQ2对不同基础模型而言,微调与冻结主干网络对性能有何影响?
  • RQ3基础模型中的早期层与晚期层在多大程度上表现出可迁移的特征用于医学任务?
  • RQ4为何某些基础模型(如 SAM、BLIP)尽管在自然视觉任务中具备强大的零样本能力,但在医学影像中仍表现不佳?
  • RQ5预训练目标(自监督 vs. 带文本的对比学习)如何影响向医学影像的可迁移性?

主要发现

  • DINOv2 在所有四个医学数据集中均持续优于 ImageNet-1k 监督预训练基线,展现出更优的可迁移性。
  • SAM、BLIP 和 OpenCLIP 在大多数设置下未能超越 ImageNet-1k 基线,表明其在医学影像中的泛化能力有限。
  • 冻结基础模型导致性能下降,尤其是在深层网络中,表明高层特征无法直接迁移到医学任务中。
  • 微调 DINOv2 的收敛速度更快且性能更高,可能是因为需要适应的层更少。
  • 特征相似性分析显示,早期层在不同模型间重用了特征,而晚期层在微调过程中发生了显著适应,表明任务特定的适应至关重要。
  • 添加 DeiT 分类器仅带来微小收益,表明基础模型的高层特征并非下游医学分类器的理想输入。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。