Skip to main content
QUICK REVIEW

[论文解读] What Makes Transfer Learning Work For Medical Images: Feature Reuse & Other Factors

C. Matsoukas, Johan Fredin Haslum|arXiv (Cornell University)|Mar 2, 2022
AI in cancer detection被引用 8
一句话总结

本文研究了为何从 ImageNet 迁移到医学影像领域的迁移学习有效,表明特征复用是性能提升的主要驱动力,尤其是在视觉变换器(ViTs)以及小样本或领域差异较大的数据集上。研究发现,当数据有限、领域相近且模型归纳偏差较低时,迁移学习效果最佳,其中特征复用在 ViTs 的早期层集中,而在 CNN 中则分布更均匀。

ABSTRACT

Transfer learning is a standard technique to transfer knowledge from one domain to another. For applications in medical imaging, transfer from ImageNet has become the de-facto approach, despite differences in the tasks and image characteristics between the domains. However, it is unclear what factors determine whether - and to what extent - transfer learning to the medical domain is useful. The long-standing assumption that features from the source domain get reused has recently been called into question. Through a series of experiments on several medical image benchmark datasets, we explore the relationship between transfer learning, data size, the capacity and inductive bias of the model, as well as the distance between the source and target domain. Our findings suggest that transfer learning is beneficial in most cases, and we characterize the important role feature reuse plays in its success.

研究动机与目标

  • 理解促使从 ImageNet 向医学影像领域成功迁移学习的因素。
  • 在近期对特征复用假说提出挑战的背景下,重新评估特征复用在迁移学习中的作用。
  • 研究模型架构(CNN 与 ViT)、数据量、领域相似性及归纳偏差对迁移学习性能的影响。
  • 表征不同网络架构和数据集上特征复用的空间分布特性。
  • 提供一个全面且基于实证的迁移学习效用图景,超越 CheXpert 等大样本数据集的孤立案例。

提出的方法

  • 在五个医学影像基准数据集上开展受控实验:APTOS 2019、CBIS-DDSM、ISIC 2019、CheXpert 和 PatchCamelyon。
  • 评估四种归纳偏差逐步增强的模型族:DeiT-S(最低)、Swin-T、Inception 和 ResNet50(最高),覆盖不同数据规模。
  • 通过迁移学习(WT)与随机初始化(RI)的性能对比衡量性能增益,并将增益分解为权重统计与特征复用两部分。
  • 采用多种指标评估特征复用:激活相似性、梯度流动以及微调过程中各层的特征稳定性。
  • 使用 FID 量化 ImageNet 与目标医学数据集之间的领域距离。
  • 进行消融研究,以隔离归纳偏差对模型容量的影响。

实验结果

研究问题

  • RQ1在从 ImageNet 向医学影像迁移学习中,特征复用在多大程度上解释了性能增益?
  • RQ2数据量以及 ImageNet 与医学数据集之间的领域距离在多大程度上影响迁移学习的有效性?
  • RQ3模型中归纳偏差的强度在多大程度上影响其对迁移学习和特征复用的依赖?
  • RQ4视觉变换器(ViTs)与卷积神经网络(CNNs)在特征复用的空间分布上存在何种差异?
  • RQ5在何种条件下迁移学习带来的增益最小,且这些增益是否可归因于权重统计而非特征复用?

主要发现

  • 在大多数医学影像数据集中,迁移学习均带来显著的性能增益,尤其在数据稀缺或领域与 ImageNet 接近时效果更明显。
  • 特征复用与性能增益高度相关,尤其在视觉变换器(ViTs)中,早期层特征最为关键且被高度复用。
  • 低归纳偏差模型(如 DeiT-S)对特征复用的依赖最强,而高归纳偏差模型(如 ResNet50)除非数据量小或领域相似,否则受益较少。
  • 在 ViTs 中,特征复用集中于早期层,丢弃后期层对性能影响极小,表明早期特征具有‘粘性’。
  • 在 CNN 中,特征复用在各层间分布更均匀,特征复杂度逐步提升,但在大规模或领域差异大的数据集中增益可能趋于平缓。
  • 孤立案例中特征复用作用减弱(见 [36, 30])仅出现在像 CheXpert 这类大规模、远距离数据集中,此时增益微小,主要源于权重统计而非特征复用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。