[论文解读] When is a Foundation Model a Foundation Model
本文研究了像 CLIP 及其变体这样的基础模型(FMs)是否真的在数字病理学中优于传统的深度神经网络。尽管这些模型规模庞大,并在海量数据上进行了预训练,但 PLIP 和 BiomedCLIP 等模型在全切片图像(WSI)检索任务中的表现仍逊于更小、更具任务特异性的网络(如 KimiaNet 和 DinoSSLPath),表明在组织病理学表征学习中,数据质量与领域特定微调的重要性超过模型规模。
Recently, several studies have reported on the fine-tuning of foundation models for image-text modeling in the field of medicine, utilizing images from online data sources such as Twitter and PubMed. Foundation models are large, deep artificial neural networks capable of learning the context of a specific domain through training on exceptionally extensive datasets. Through validation, we have observed that the representations generated by such models exhibit inferior performance in retrieval tasks within digital pathology when compared to those generated by significantly smaller, conventional deep networks.
研究动机与目标
- 评估在多样化、非临床数据源(如社交媒体)上预训练的基础模型是否在组织病理学表征学习中优于传统深度神经网络。
- 评估 CLIP、BiomedCLIP 和 PLIP 等基础模型在患者匹配任务中用于全切片图像(WSI)检索的有效性。
- 将基础模型与在高质量、临床病理学数据上训练的小型、任务特定模型(如 KimiaNet、DinoSSLPath)的性能进行比较。
- 探究当以 WSI 到 WSI 匹配的下游准确率作为衡量标准时,'基础模型'这一标签是否合理。
- 确定在实现数字病理学最优表征时,数据质量与领域特定性是否优于模型规模和预训练范围。
提出的方法
- 使用来自公共病理学社区和在线来源的组织学图像,对基础模型 CLIP、BiomedCLIP 和 PLIP 进行微调。
- 在 TCGA 数据库上,分别使用监督学习和自监督学习方法训练传统模型 KimiaNet(基于 DenseNet)和 DinoSSLPath(基于视觉 Transformer)。
- 使用 CLIP、BiomedCLIP、PLIP、DinoSSLPath 和 KimiaNet 从全切片图像(WSIs)中提取局部图像块特征。
- 应用 Yottixel 搜索引擎,采用 'mosaic' 图像块划分方式和 '最小值的中位数' 匹配策略,执行 WSI 到 WSI 的检索。
- 通过留一患者交叉验证和在内部及公开数据集上的 F1 分数(MV@k)评估性能。
- 使用 MV@k(top-k 检索结果中多数投票的结果)计算平均 F1 分数,综合考虑精确率与召回率。
实验结果
研究问题
- RQ1在非临床、互联网来源的组织病理学数据上微调的基础模型是否在 WSI 到 WSI 的检索任务中优于传统深度神经网络?
- RQ2基础模型在数字病理学中的表现是否受限于其预训练数据的质量与临床相关性?
- RQ3更小、更具任务特异性的模型(如 KimiaNet 和 DinoSSLPath)是否能在组织病理学表征学习中超越基础模型?
- RQ4在医学影像中,何种条件下可认为一个模型是真正的基础模型——依据性能还是数据质量?
- RQ5当基础模型在下游诊断任务中的表现落后于更小、领域特定的模型时,'基础模型'这一标签是否仍具合理性?
主要发现
- KimiaNet 在内部皮肤癌数据集上实现了最高的 Top-1 准确率(78%),优于所有基础模型,包括 PLIP(63%)和 CLIP(62%)。
- DinoSSLPath 在内部肝病数据集上表现最佳,Top-1 准确率达到 65%,超过 PLIP(59%)和 BiomedCLIP(59%)。
- 在公开的 DigestPath CTS 数据集上,DinoSSLPath 实现了最高的 MV@5 分数(91.5%),优于 PLIP(84.1%)和 BiomedCLIP(87.2%)。
- 在公开的 DigestPath SRCC 数据集上,DinoSSLPath 实现了 MV@5 分数 98.8%,显著优于 PLIP(90.8%)和 BiomedCLIP(95.4%)。
- 在内部数据集上,KimiaNet 实现了最高的总 F1 分数(65% ± 6%),优于 PLIP(60% ± 6%)和 CLIP(55% ± 10%)。
- 在公开数据集上,DinoSSLPath 实现了最高的总 F1 分数(82.3% ± 22%),优于 PLIP(79.1% ± 23%)和 BiomedCLIP(78.7% ± 22%)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。