Skip to main content
QUICK REVIEW

[论文解读] OmniScreen model predictions and evaluation of the MSK and TCGA datasets

Yi Kan Wang, L. Trlifaj Tydlitatova|arXiv (Cornell University)|Aug 18, 2024
Genetics, Bioinformatics, and Biomedical ResearchBiochemistry, Genetics and Molecular Biology被引用 3
一句话总结

本研究提出OmniScreen,一种基于Virchow2基础模型的统一AI模型,可从15种常见癌症的苏木精-伊苏红(H&E)全切片图像(WSIs)中预测505种分子生物标志物。该模型在80种高性能生物标志物上的平均AUROC达到0.89,实现了无需破坏组织的高通量、低成本泛癌生物标志物筛查,可用于基因组和表型生物标志物的检测。

ABSTRACT

Molecular assays are standard of care for detecting genomic alterations in cancer prognosis and therapy selection but are costly, tissue-destructive and time-consuming. Artificial intelligence (AI) applied to routine hematoxylin and eosin (H&E)-stained whole slide images (WSIs) offers a fast and economical alternative for screening molecular biomarkers. We introduce OmniScreen, a high-throughput AI-based system leveraging Virchow2 embeddings extracted from 60,529 cancer patients with paired 489-gene MSK-IMPACT targeted biomarker panel and WSIs. Unlike conventional approaches that train separate models for each biomarker, OmniScreen employs a unified model to predict a broad range of clinically relevant biomarkers across cancers, including low-prevalence targets impractical to model individually. OmniScreen reliably identifies therapeutic targets and shared phenotypic features across common and rare tumors. We investigate the biomarker prediction probabilities and accuracies of OmniScreen in relation to tumor area, cohort size, histologic subtype alignment, and pathway-level morphological patterns. These findings underscore the potential of OmniScreen for routine clinical screening.

研究动机与目标

  • 开发一种高通量、低成本的方法,从常规H&E全切片图像(WSIs)中筛查多种分子生物标志物,避免破坏组织且耗时的下一代测序(NGS)检测。
  • 通过训练一个统一模型,克服单一生物标志物模型的局限性,实现同时预测多种癌症类型中多样化的生物标志物。
  • 在H&E全切片图像中识别与临床相关基因组改变相关的数字生物标志物,包括治疗靶点、DNA修复缺陷及基因组不稳定性指标。
  • 在独立的MSK和TCGA队列中评估模型性能,证明其在多种癌症组织学类型和样本类型中的鲁棒性与泛化能力。
  • 推动更广泛的临床与制药应用,包括改善患者分层、临床试验筛查及新靶点发现。

提出的方法

  • 模型使用在300万张H&E全切片图像上预训练的Virchow2基础模型,从全切片图像中224×224像素的组织切片中提取2,560维嵌入向量。
  • 在生成嵌入前,基于形态学相关性对组织切片进行筛选和选择,确保仅使用相关组织学区域进行表征。
  • 训练一个统一的多标签分类头,用于从MSK-IMPACT面板预测505个基因水平生物标志物,以及通路活性和基因组不稳定性指标。
  • 模型在来自38,984名患者的47,960张H&E全切片图像上进行训练,验证集经调优,最终评估在独立的MSK和TCGA测试集上进行。
  • 使用AUROC、敏感性、特异性及阳性样本比例阈值评估模型性能,以识别高性能生物标志物。
  • 该方法可实现无需为每个目标重新训练,即可同时预测多种生物标志物,如TMB、MSI、CIN及信号通路活性。

实验结果

研究问题

  • RQ1一个单一的、统一的深度学习模型能否在多种癌症类型中,准确预测来自常规H&E全切片图像的505种临床相关分子生物标志物?
  • RQ2OmniScreen模型在预测已知基因组改变方面,与传统NGS检测方法相比表现如何,特别是在AUROC和敏感性方面?
  • RQ3从H&E图像中提取的数字生物标志物在多大程度上可预测临床可操作靶点、DNA修复缺陷及基因组不稳定性表型(如TMB和MSI)?
  • RQ4该模型能否在原发性和转移性肿瘤样本之间实现泛化?其性能在不同样本类型间如何变化?
  • RQ5该模型能否识别组织病理学特征与特定癌症亚型或治疗反应标志物之间的新关联?

主要发现

  • 模型在15种最常见癌症类型中识别出80种高性能生物标志物,平均AUROC达0.89,表现出强劲的预测能力。
  • 40种生物标志物与特定组织学亚型显著相关,表明其与分子异质性的形态学相关性。
  • 58种生物标志物与临床相关靶点相关,可用于治疗选择和反应预测,显著提升临床实用性。
  • 模型成功预测了五个经典信号通路(TGF-β、RTK、HRD、mTOR、DDR)的活性,其中14项通路及不稳定性指标AUC >0.75。
  • 基因组不稳定性指标(如肿瘤突变负担TMB、微卫星不稳定性MSI-H、染色体不稳定CIN)的预测AUC均 >0.75,支持其在免疫治疗和靶向治疗选择中的应用。
  • 80种生物标志物的敏感性(>0.8)和特异性(>0.3)均较高,且阳性样本数不少于50例,阳性比例 >2%,表明其具备临床可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。