Skip to main content
QUICK REVIEW

[论文解读] Benchmarking Self-Supervised Learning on Diverse Pathology Datasets

Mingu Kang, Heon Song|arXiv (Cornell University)|Dec 9, 2022
AI in cancer detection被引用 6
一句话总结

本论文在 The Cancer Genome Atlas (TCGA) 的大规模病理全切片图像(WSI)上对四种自监督学习(SSL)方法——MoCo v2、SwAV、Barlow Twins 和 DINO 进行基准测试,表明领域对齐的预训练显著优于 ImageNet 预训练,且在多种下游任务(包括分类和细胞核实例分割)中表现更优。主要贡献在于提出了一套针对病理领域的数据筛选与增强技术,显著提升了性能,尤其在低标签数据设置下;并首次成功将 SSL 应用于病理学中的密集预测任务。

ABSTRACT

Computational pathology can lead to saving human lives, but models are annotation hungry and pathology images are notoriously expensive to annotate. Self-supervised learning has shown to be an effective method for utilizing unlabeled data, and its application to pathology could greatly benefit its downstream tasks. Yet, there are no principled studies that compare SSL methods and discuss how to adapt them for pathology. To address this need, we execute the largest-scale study of SSL pre-training on pathology image data, to date. Our study is conducted using 4 representative SSL methods on diverse downstream tasks. We establish that large-scale domain-aligned pre-training in pathology consistently out-performs ImageNet pre-training in standard SSL settings such as linear and fine-tuning evaluations, as well as in low-label regimes. Moreover, we propose a set of domain-specific techniques that we experimentally show leads to a performance boost. Lastly, for the first time, we apply SSL to the challenging task of nuclei instance segmentation and show large and consistent performance improvements under diverse settings.

研究动机与目标

  • 评估自监督学习(SSL)在大规模病理图像数据上的有效性,相较于 ImageNet 预训练。
  • 识别自然图像与病理图像之间的关键差异,这些差异导致标准 SSL 方法难以迁移。
  • 设计并验证针对病理数据的领域特定数据筛选与增强策略,以提升 SSL 在病理数据上的性能。
  • 展示 SSL 在计算病理学中常见的低资源设置下的标签效率。
  • 首次将 SSL 应用于具有挑战性的细胞核实例分割任务,并评估其性能。

提出的方法

  • 在 The Cancer Genome Atlas (TCGA) 的 1900 万个全切片图像(WSI)图像块上,使用 MoCo v2、SwAV、Barlow Twins 和 DINO 进行 SSL 模型预训练。
  • 引入针对病理图像的领域特定数据增强策略,包括旋转不变性与色彩增强,以更好地捕捉形态学与上下文特征。
  • 在五个数据集上应用线性评估与微调协议:BACH、CRC、PatchCamelyon(分类),以及 CoNSeP(细胞核实例分割)。
  • 采用双阶段数据筛选流程,过滤低质量图像块,确保预训练数据的多样性与代表性。
  • 通过视觉变换器(ViT)的注意力图分析,比较自监督与监督预训练在可解释性与特征定位方面的差异。
  • 在 Camelyon16 上使用 CLAM 风格的特征聚合方法,开展切片级分类实验,评估模型在全切片分析中的迁移能力。

实验结果

研究问题

  • RQ1在下游病理分类与分割任务中,基于病理数据的自监督预训练是否优于 ImageNet 预训练?
  • RQ2与标准增强方法相比,领域特定的数据增强与筛选技术在病理图像上的 SSL 性能提升程度如何?
  • RQ3在病理学中常见的低样本学习场景下,SSL 的标签效率在多大程度上得以体现?
  • RQ4SSL 能否有效应用于如组织病理学中细胞核实例分割等密集预测任务?
  • RQ5通过注意力可视化,自监督模型是否学习到比 ImageNet 预训练模型更具可解释性与生物学相关性的特征?

主要发现

  • 在 TCGA WSI 图像块上进行大规模领域对齐预训练,在所有下游任务(包括线性评估与微调)中均一致优于 ImageNet 预训练。
  • 所提出的领域特定数据增强与筛选技术在所有 SSL 方法与数据集中均带来显著且一致的性能提升。
  • SSL 展现出强大的标签效率,在 CoNSeP 数据集中仅使用 10% 的标注数据时即达到高性能,优于 ImageNet 基线模型。
  • 首次成功将 SSL 应用于细胞核实例分割任务,其中 Barlow Twins 在边界检测与细胞分离方面优于 ImageNet 监督基线模型。
  • 注意力可视化显示,自监督的 ViT 模型能够定位细胞与形态学表型(如上皮细胞、炎症细胞、成纤维细胞),而 ImageNet 预训练的 ViT 无法生成可解释的注意力模式。
  • 在 Camelyon16 上的切片级分类实验中,使用 TCGA 预训练的 MoCo v2 模型达到 AUROC 0.986,而 ImageNet 预训练模型仅为 0.927,证实了在全切片层面领域对齐预训练的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。