Skip to main content
QUICK REVIEW

[论文解读] Scaling Vision Transformers to Gigapixel Images via Hierarchical Self-Supervised Learning

Richard J. Chen, Chengkuan Chen|arXiv (Cornell University)|Jun 6, 2022
Cell Image Analysis Techniques被引用 8
一句话总结

该论文提出HIPT,一种分层视觉Transformer架构,通过多尺度自监督学习来表征计算病理学中的吉字节全切片图像(WSIs)。通过在33种癌症类型的10,678张WSI上进行预训练,使用1.04亿个$256\times256$图像块和40.8万个$4096\times4096$区域,HIPT在滑动级别任务(如癌症亚型分类和生存预测)中达到最先进性能,表明分层自监督学习能够捕捉肿瘤微环境中关键的空间和表型归纳偏置。

ABSTRACT

Vision Transformers (ViTs) and their multi-scale and hierarchical variations have been successful at capturing image representations but their use has been generally studied for low-resolution images (e.g. - 256x256, 384384). For gigapixel whole-slide imaging (WSI) in computational pathology, WSIs can be as large as 150000x150000 pixels at 20X magnification and exhibit a hierarchical structure of visual tokens across varying resolutions: from 16x16 images capture spatial patterns among cells, to 4096x4096 images characterizing interactions within the tissue microenvironment. We introduce a new ViT architecture called the Hierarchical Image Pyramid Transformer (HIPT), which leverages the natural hierarchical structure inherent in WSIs using two levels of self-supervised learning to learn high-resolution image representations. HIPT is pretrained across 33 cancer types using 10,678 gigapixel WSIs, 408,218 4096x4096 images, and 104M 256x256 images. We benchmark HIPT representations on 9 slide-level tasks, and demonstrate that: 1) HIPT with hierarchical pretraining outperforms current state-of-the-art methods for cancer subtyping and survival prediction, 2) self-supervised ViTs are able to model important inductive biases about the hierarchical structure of phenotypes in the tumor microenvironment.

研究动机与目标

  • 为解决现有弱监督多实例学习(MIL)框架在计算病理学中的局限性,这些框架固定于$256\times256$图像块级别的表征,并缺乏对长程依赖关系的注意力机制。
  • 通过利用WSI在多个分辨率下的固有分层结构,实现吉字节全切片图像中有效的滑动级别表征学习。
  • 开发一种视觉Transformer架构,通过自监督学习联合预训练分词和聚合组件,提升低数据场景下的泛化能力。
  • 验证分层自监督预训练是否能捕捉肿瘤微环境中具有生物意义的归纳偏置,如肿瘤-免疫细胞定位和空间表型组织模式。

提出的方法

  • 提出分层图像金字塔Transformer(HIPT),一种三阶段架构,从$16\times16$细胞级标记逐步进行自底向上的聚合,生成$256\times256$和$4096\times4096$区域表征。
  • 采用两阶段自监督预训练:首先在$256\times256$图像块上,然后在$4096\times4096$区域上,使用对比学习与实例判别方法。
  • 使用以$16\times16$图像块嵌入为基础的ViT主干网络作为基础特征提取器,并为$256\times256$和$4096\times4096$尺度分别设置独立的ViT编码器。
  • 应用分解注意力机制以可视化分层注意力图,实现对肿瘤细胞和免疫细胞定位的可解释性。
  • 执行分阶段预训练:首先在1.04亿个$256\times256$图像块实例上进行,然后在40.8万个$4096\times4096$区域实例上进行。
  • 使用最后四个ViT层的[CLS]标记进行特征拼接,但未观察到性能提升。

实验结果

研究问题

  • RQ1与标准MIL框架相比,视觉Transformer的分层自监督预训练是否能提升吉字节全切片图像中的滑动级别表征学习?
  • RQ2建模从$16\times16$细胞到$4096\times4096$组织区域的多尺度视觉标记,是否能捕捉肿瘤微环境中具有生物学意义的归纳偏置?
  • RQ3与器官特异性预训练相比,泛癌预训练在泛化能力和注意力图可解释性方面表现如何?
  • RQ4自监督ViT是否能在癌症亚型分类和生存预测任务中超越有监督或弱监督MIL基线?
  • RQ5分层注意力机制在多大程度上能准确定位临床相关特征,如肿瘤巢、间质浸润和免疫细胞浸润?

主要发现

  • 采用分层预训练的HIPT在9项滑动级别任务中达到最先进性能,优于当前最先进方法,在癌症亚型分类和生存预测任务中表现更优。
  • 在33种癌症类型上进行的泛癌预训练相比器官特异性预训练展现出更好的泛化能力,尤其在不同组织病理学模式下对肿瘤细胞和淋巴细胞的定位方面表现更优。
  • 该模型展现出优越的可解释性,其分层注意力图成功定位了在纤维组织中浸润的肿瘤细胞以及对区分浸润性导管癌与小叶癌至关重要的肿瘤巢模式。
  • 在BRCA亚型分类任务中,泛癌预训练的HIPT优于BRCA特异性预训练,可能是因为更有效地捕捉了区分表型相似亚型所必需的间质微环境信息。
  • 自监督ViT能够建模组织微环境中跨区域的长程空间依赖关系,通过关注肿瘤-免疫细胞定位,实现准确的生存预测。
  • 跨ViT层的特征拼接未提升性能,表明最后一层的[CLS]标记已足够满足下游任务需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。