[论文解读] MedFMC: A Real-world Dataset and Benchmark For Foundation Model Adaptation in Medical Image Classification
本文提出 MedFMC,一个包含 22,349 幅图像的现实世界医学图像分类基准,涵盖五个多样的临床任务——胸部 X 光、病理学、内窥镜、新生儿黄疸和糖尿病视网膜病变。该研究评估了基于提示的微调与微调方法在基础模型少样本适应中的表现,结果表明,少样本方法,尤其是 VPT,在罕见疾病类别上表现出更优且更稳定的性能,且在 10-shot 实验中方差极低。
Foundation models, often pre-trained with large-scale data, have achieved paramount success in jump-starting various vision and language applications. Recent advances further enable adapting foundation models in downstream tasks efficiently using only a few training samples, e.g., in-context learning. Yet, the application of such learning paradigms in medical image analysis remains scarce due to the shortage of publicly accessible data and benchmarks. In this paper, we aim at approaches adapting the foundation models for medical image classification and present a novel dataset and benchmark for the evaluation, i.e., examining the overall performance of accommodating the large-scale foundation models downstream on a set of diverse real-world clinical tasks. We collect five sets of medical imaging data from multiple institutes targeting a variety of real-world clinical tasks (22,349 images in total), i.e., thoracic diseases screening in X-rays, pathological lesion tissue screening, lesion detection in endoscopy images, neonatal jaundice evaluation, and diabetic retinopathy grading. Results of multiple baseline methods are demonstrated using the proposed dataset from both accuracy and cost-effective perspectives.
研究动机与目标
- 解决当前缺乏公开、多样化且现实世界医学图像分类基础模型适应评估数据集的问题。
- 实现跨多种医学影像模态和临床任务的少样本学习方法基准测试,以评估其泛化能力。
- 在有限数据条件下评估成本效益高的适应技术,特别是基于提示的学习方法,以模拟真实临床场景中标签数据稀缺的情况。
- 证明当数据极度有限时,少样本方法在罕见疾病类别上优于微调方法。
- 提供一个标准化、公开可用的数据集和代码库,以加速医学影像基础模型适应研究。
提出的方法
- 从五个临床机构收集了 22,349 幅真实世界的 2D 医学图像,涵盖多种模态:X 射线、病理学、内窥镜、数字摄影和眼底照相。
- 构建了五个独立的分类任务:多标签胸部异常(ChestDR)、二分类胃肠道病变检测(ColonPath)、多标签结直肠病变检测(Endo)、二分类新生儿黄疸评估(NeoJaundice)以及多类糖尿病视网膜病变分级(Retino)。
- 评估了多种少样本学习基线方法,包括 Meta-baseline、VPT(视觉提示微调)以及使用 ImageNet 预训练主干网络(如 Swin-T、ResNeXt)的标准微调。
- 采用可学习视觉标记的基于提示的微调(VPT)方法,仅使用 10–20% 的数据来适应基础模型,最大限度减少参数更新。
- 使用标准评估指标:准确率、AUC、mAP 和平均精度,进行 10 次重复实验以评估少样本设置下的方差。
- 将少样本方法与使用 20% 少样本池数据的完整微调进行比较,并评估数据增强对性能的影响。

实验结果
研究问题
- RQ1在数据有限的情况下,少样本适应方法能否在多样化、现实世界的医学图像分类任务中实现有效泛化?
- RQ2在医学影像基准上,基于提示的方法(如 VPT)与标准微调在准确率、稳定性及数据效率方面相比如何?
- RQ3与常见类别相比,少样本方法在罕见疾病类别上的分类性能提升程度如何?
- RQ4在多次重复的少样本实验中,性能的方差如何?不同数据划分下的结果稳定性如何?
- RQ5当仅有少量样本时,数据增强是否显著提升微调性能?
主要发现
- VPT 在所有少样本基线方法中表现最佳,展现出在全部五个医学图像分类任务中的卓越泛化能力。
- 在仅提供 10 个样本时,少样本方法(尤其是 VPT)的表现优于微调方法,且与使用 20% 数据的完整微调相比性能下降极小。
- 在 10 次重复的 10-shot 实验中,准确率和 AUC 的方差始终低于 5%,表明少样本学习结果具有高度稳定性。
- 在胸部 X 光分类中,罕见疾病类别(尾部类别)使用少样本方法获得了更高或相当的 AUC 值,表明对低频疾病具有更强的鲁棒性。
- 使用 1–5 个样本进行微调时,结果常因过拟合或欠拟合而极不稳定,凸显了传统微调在极低数据场景下的关键局限性。
- 数据增强对微调性能的影响微乎其微,表明在极端低样本设置下,数据效率更多取决于模型适应策略而非数据增强。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。