[论文解读] DeepSMILE: Self-supervised heterogeneity-aware multiple instance learning for DNA damage response defect classification directly from H&E whole-slide images
DeepSMILE 是一种自监督、异质性感知的多实例学习框架,可直接从 H&E 全切片图像中分类 DNA 损伤应答缺陷——同源重组缺陷(HRD)和微卫星不稳定性(MSI),而无需像素级或瓦片级标注。通过结合对比自监督预训练与可变性感知的深度多实例学习,其在多中心乳腺癌和结直肠癌数据集上的 AUC 性能分别提升至 83.79±1.25%(HRD)和 90.32±3.58%(MSI)。
We propose a Deep learning-based weak label learning method for analysing whole slide images (WSIs) of Hematoxylin and Eosin (H&E) stained tumorcells not requiring pixel-level or tile-level annotations using Self-supervised pre-training and heterogeneity-aware deep Multiple Instance LEarning (DeepSMILE). We apply DeepSMILE to the task of Homologous recombination deficiency (HRD) and microsatellite instability (MSI) prediction. We utilize contrastive self-supervised learning to pre-train a feature extractor on histopathology tiles of cancer tissue. Additionally, we use variability-aware deep multiple instance learning to learn the tile feature aggregation function while modeling tumor heterogeneity. Compared to state-of-the-art genomic label classification methods, DeepSMILE improves classification performance for HRD from $70.43\pm4.10\%$ to $83.79\pm1.25\%$ AUC and MSI from $78.56\pm6.24\%$ to $90.32\pm3.58\%$ AUC in a multi-center breast and colorectal cancer dataset, respectively. These improvements suggest we can improve genomic label classification performance without collecting larger datasets. In the future, this may reduce the need for expensive genome sequencing techniques, provide personalized therapy recommendations based on widely available WSIs of cancer tissue, and improve patient care with quicker treatment decisions - also in medical centers without access to genome sequencing resources.
研究动机与目标
- 开发一种弱监督深度学习方法,无需详细标注即可从 H&E 全切片图像中分类癌症基因组缺陷。
- 通过在分类过程中建模瓦片级特征中的可变性,解决组织病理学图像中的肿瘤异质性问题。
- 利用无标签组织病理学瓦片上的自监督预训练,提升基因组标签分类性能。
- 在基因组测序不可用的资源有限环境中,实现实现 HRD 和 MSI 的准确预测。
- 通过利用广泛可用的 H&E 染色全切片图像,减少对昂贵基因组测序的依赖,支持个性化治疗推荐。
提出的方法
- 利用对比自监督学习在 H&E 染色全切片图像的组织病理学瓦片上预训练特征提取器。
- 应用异质性感知的深度多实例学习(MIL)框架,在建模肿瘤空间可变性的同时聚合瓦片级特征。
- 利用弱切片级标签(如 HRD 或 MSI 状态)进行端到端训练,无需像素级或瓦片级标注。
- 采用可学习的聚合函数,考虑全切片图像内各瓦片间特征的可变性。
- 在多中心乳腺癌和结直肠癌全切片图像数据集上训练模型,以确保跨机构的泛化能力。
- 在自监督预训练阶段采用孪生网络架构,通过对比数据增强学习判别性表征。
实验结果
研究问题
- RQ1在无标签组织病理学瓦片上进行自监督预训练,能否提升 HRD 和 MSI 的下游基因组标签分类性能?
- RQ2通过可变性感知 MIL 框架建模肿瘤异质性,相较于标准 MIL 方法,能否显著提升分类准确率?
- RQ3在无需像素级标注的情况下,弱监督深度学习模型在 HRD 和 MSI 预测中能达到多高的 AUC?
- RQ4所提出的方法能否在具有不同染色和成像协议的多中心数据集上实现良好泛化?
- RQ5自监督学习与异质性感知 MIL 的结合,能否在临床决策中减少对昂贵基因组测序的依赖?
主要发现
- DeepSMILE 在多中心乳腺癌数据集上将 HRD 分类的 AUC 从 70.43±4.10% 提升至 83.79±1.25%。
- 在结直肠癌数据集上,MSI 预测的 AUC 从 78.56±6.24% 提升至 90.32±3.58%。
- 性能提升无需收集更大规模的标注数据集,证明了自监督预训练的有效性。
- 该模型在多中心数据集上表现出良好泛化能力,表明其对染色和成像协议差异具有鲁棒性。
- 该框架可直接从标准 H&E WSIs 实现准确的基因组缺陷分类,减少对昂贵基因组测序的依赖。
- 结果表明,DeepSMILE 可在缺乏基因组测序能力的临床环境中支持个性化治疗推荐。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。