Skip to main content
QUICK REVIEW

[论文解读] Transcriptomics-guided Slide Representation Learning in Computational Pathology

Guillaume Jaume, Lukas Oldenburg|arXiv (Cornell University)|May 19, 2024
Gene expression and cancer classificationBiochemistry, Genetics and Molecular Biology被引用 3
一句话总结

该论文提出 Tangle,一种自监督多模态框架,通过组织学切片与基因表达谱之间的对比学习,利用转录组学数据引导全切片图像(WSI)表示学习。在涵盖肝、乳腺和肺组织的8,629对人类和大鼠(S+E)数据上进行预训练后,Tangle 在独立测试队列(包含1,265幅乳腺、1,946幅肺和4,584幅肝 WSI)上的 few-shot 分类与切片检索任务中均达到最先进性能,显著优于监督和自监督基线方法。

ABSTRACT

Self-supervised learning (SSL) has been successful in building patch embeddings of small histology images (e.g., 224x224 pixels), but scaling these models to learn slide embeddings from the entirety of giga-pixel whole-slide images (WSIs) remains challenging. Here, we leverage complementary information from gene expression profiles to guide slide representation learning using multimodal pre-training. Expression profiles constitute highly detailed molecular descriptions of a tissue that we hypothesize offer a strong task-agnostic training signal for learning slide embeddings. Our slide and expression (S+E) pre-training strategy, called Tangle, employs modality-specific encoders, the outputs of which are aligned via contrastive learning. Tangle was pre-trained on samples from three different organs: liver (n=6,597 S+E pairs), breast (n=1,020), and lung (n=1,012) from two different species (Homo sapiens and Rattus norvegicus). Across three independent test datasets consisting of 1,265 breast WSIs, 1,946 lung WSIs, and 4,584 liver WSIs, Tangle shows significantly better few-shot performance compared to supervised and SSL baselines. When assessed using prototype-based classification and slide retrieval, Tangle also shows a substantial performance improvement over all baselines. Code available at https://github.com/mahmoodlab/TANGLE.

研究动机与目标

  • 解决从千兆像素级全切片图像(WSI)中学习鲁棒、可泛化的切片嵌入表示的挑战,而无需依赖昂贵的病理学家标注。
  • 探究基因表达谱(提供高分辨率分子上下文)是否可作为切片表示学习的强监督信号,且与任务无关。
  • 开发一种多模态对比学习框架,将视觉切片特征与分子表达嵌入对齐,从而在不同组织和物种间提升泛化能力。
  • 在下游任务(如 few-shot 分类、基于原型的分类和切片检索)中评估所提方法在独立测试数据集上的性能。
  • 通过注意力可视化和嵌入空间的秩分析,分析所学表示的可解释性与质量。

提出的方法

  • Tangle 使用模态特定的编码器:为切片图像块使用视觉 Transformer,为基因表达谱使用前馈神经网络。
  • 该框架采用对称对比学习,通过在共享潜在空间中最大化其相互相似性,对齐切片与表达嵌入。
  • 预训练在 The Cancer Genome Atlas(TCGA)和 TG-GATEs 的 8,629 对(S+E)数据上进行,涵盖人类和大鼠的肝、乳腺和肺组织。
  • 通过仅使用每类少量标注样本进行线性探针微调,实现下游任务的 few-shot 学习。
  • 消融研究评估了不同损失组件的贡献,包括对称对比损失、L1 和 L2 目标,以及使用平均视图与随机视图的对比。
  • 该方法结合了局部-全局与局部-局部对齐的混合对比目标,以提升特征的鲁棒性与泛化能力。

实验结果

研究问题

  • RQ1转录组学数据能否作为自监督全切片图像表示学习的强、与任务无关的监督信号?
  • RQ2与纯视觉 SSL 或监督基线相比,组织学切片与基因表达谱之间的多模态对比学习在 few-shot 分类与切片检索中表现如何?
  • RQ3Tangle 学习到的表示在多大程度上具备可解释性,例如注意力是否自然聚焦于肿瘤等临床相关区域,而无需为这些任务进行显式训练?
  • RQ4不同对比损失组件与超参数(如批量大小、温度、图像块数量)对下游性能有何影响?
  • RQ5通过平滑秩测量的切片嵌入空间内在维度与下游分类准确率之间有何相关性?

主要发现

  • 在三个独立测试数据集(1,265 幅乳腺 WSI、1,946 幅肺 WSI 和 4,584 幅肝 WSI)上,Tangle 的 few-shot 分类性能显著优于监督基线(ABMIL)和自监督基线(Intra)。
  • 在 TG-GATEs 大鼠肝病变分类任务中,Tangle 的 AUC 达到 0.92,比次佳基线高出 7.0 个百分点。
  • Tangle 中的对称对比损失带来一致的性能提升,而 L1 和 L2 损失分别导致 AUC 下降 6.7% 和 7.0%。
  • 将 Tangle 目标与切片内对比损失(如与平均或随机视图对比)结合后,AUC 下降 2.0%,表明 (S+E) 信号已足够且具有互补性。
  • 注意力热图显示,Tangle 的冻结 ABMIL 编码器在乳腺和肺 WSI 中自然聚焦于肿瘤区域,表明其在无显式肿瘤相关监督下仍能实现潜在的生物学相关性。
  • 观察到切片嵌入矩阵的平滑秩与下游分类性能之间存在强正相关性,表明 Tangle 学习到了高维且信息丰富的潜在空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。