Skip to main content
QUICK REVIEW

[论文解读] Cats, not CAT scans: a study of dataset similarity in transfer learning for 2D medical image classification

Irma van den Brandt, Floris Fok|arXiv (Cornell University)|Jul 13, 2021
Domain Adaptation and Few-Shot Learning被引用 6
一句话总结

本研究评估了在2D医学图像分类中使用九个源数据集(涵盖自然图像(如ImageNet)到医学图像)的迁移学习效果,目标数据集为三个医学数据集。研究发现,尽管ImageNet并非医学来源,其性能仍最高;且直观的数据集相似性判断难以准确预测迁移成功与否,挑战了医学影像模型选择中的既有假设。

ABSTRACT

Transfer learning is a commonly used strategy for medical image classification, especially via pretraining on source data and fine-tuning on target data. There is currently no consensus on how to choose appropriate source data, and in the literature we can find both evidence of favoring large natural image datasets such as ImageNet, and evidence of favoring more specialized medical datasets. In this paper we perform a systematic study with nine source datasets with natural or medical images, and three target medical datasets, all with 2D images. We find that ImageNet is the source leading to the highest performances, but also that larger datasets are not necessarily better. We also study different definitions of data similarity. We show that common intuitions about similarity may be inaccurate, and therefore not sufficient to predict an appropriate source a priori. Finally, we discuss several steps needed for further research in this field, especially with regard to other types (for example 3D) medical images. Our experiments and pretrained models are available via \url{https://www.github.com/vcheplygina/cats-scans}

研究动机与目标

  • 调查源数据集来源(自然图像与医学图像)及大小对2D医学图像分类中迁移学习性能的影响。
  • 评估数据集相似性度量是否能预测针对特定目标医学数据集的最佳源数据集。
  • 识别当前关于数据相似性与可迁移性假设中的局限性。
  • 通过在公共代码库中共享预训练模型与代码,促进可复现性与资源效率。

提出的方法

  • 采用类似ResNet50的架构进行迁移学习实验,在九个多样化源数据集上预训练后,微调至三个2D医学目标数据集。
  • 使用Task2Vec计算每个数据集的数据驱动型、基于神经网络的表征,以量化相似性。
  • 收集人工标注的高层次特征(如图像模态、内容类型)以定义第二种基于专家的相似性度量。
  • 通过标准指标(如top-1准确率和AUC)比较不同源数据集的迁移性能。
  • 采用一致的预处理(如图像缩放)和训练协议以确保公平比较,尽管超参数未进行彻底调优。
  • 通过GitHub共享所有模型与代码,以支持可复现性并降低计算与环境成本。

实验结果

研究问题

  • RQ1在2D医学图像分类中,ImageNet的预训练是否优于医学专用数据集的预训练?
  • RQ2数据集大小与来源(自然图像 vs. 医学图像)如何影响迁移学习性能?
  • RQ3数据驱动或专家定义的相似性度量能否预测针对特定目标数据集的最有效源数据集?
  • RQ4关于数据集相似性的常见直觉在多大程度上与实际迁移性能相关?
  • RQ5模型架构与数据模态(如2D RGB与3D模态)如何影响可迁移性及相似性假设的有效性?

主要发现

  • 尽管ImageNet并非医学数据集,其在所有目标医学数据集上均实现了最高的迁移学习性能,优于专门的医学源数据集。
  • 更大的数据集大小并不保证更好的迁移性能;较小的非医学数据集仍可取得优异结果。
  • 关于数据集相似性的常见直觉(如视觉或类别层面的相似性)与实际迁移性能的相关性极弱甚至无相关性。
  • 出人意料的是,通过人工评估或Task2Vec确定的最相似数据集,往往带来最低的性能提升,与初始预期相悖。
  • 尽管Task2Vec相似性度量是数据驱动的,但其依赖于在ImageNet上预训练的主干网络,可能存在偏差,限制了其泛化能力。
  • 本研究强调需要更多样化的数据集,尤其是3D医学图像,并呼吁建立共享模型仓库以减少重复工作与环境影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。