[论文解读] From Modern CNNs to Vision Transformers: Assessing the Performance, Robustness, and Classification Strategies of Deep Learning Models in Histopathology
本文评估了最先进的深度学习模型——从现代CNN(如ConvNeXt和Inception)到视觉Transformer(ViT和Swin Transformer)——在组织病理学中的表现,评估了其性能、对染色变异的鲁棒性以及可解释性。该研究提出了一种新颖的方法,利用CycleGAN评估染色鲁棒性,并将层间相关性传播(LRP)方法扩展至量化注意力在细胞核上的聚焦程度,结果表明尽管所有模型均优先关注细胞核,但其策略存在细微差异,且各类架构的鲁棒性仍是关键局限。
While machine learning is currently transforming the field of histopathology, the domain lacks a comprehensive evaluation of state-of-the-art models based on essential but complementary quality requirements beyond a mere classification accuracy. In order to fill this gap, we developed a new methodology to extensively evaluate a wide range of classification models, including recent vision transformers, and convolutional neural networks such as: ConvNeXt, ResNet (BiT), Inception, ViT and Swin transformer, with and without supervised or self-supervised pretraining. We thoroughly tested the models on five widely used histopathology datasets containing whole slide images of breast, gastric, and colorectal cancer and developed a novel approach using an image-to-image translation model to assess the robustness of a cancer classification model against stain variations. Further, we extended existing interpretability methods to previously unstudied models and systematically reveal insights of the models' classifications strategies that can be transferred to future model architectures.
研究动机与目标
- 全面评估现代深度学习模型在组织病理学中的表现,超越准确率,涵盖鲁棒性与可解释性。
- 评估最先进模型(尤其是视觉Transformer)在多种组织病理学数据集(涵盖不同癌症类型)上的性能。
- 开发并应用一种新颖的定量方法,通过图像到图像转换(CycleGAN)评估模型对染色变异的鲁棒性。
- 将可解释性技术(LRP)扩展至此前未研究的模型,并量化模型对生物相关区域(如细胞核)的关注程度。
- 为深度学习在数字病理学中临床部署提供可操作的模型推荐及可迁移的评估框架。
提出的方法
- 在五个公开的组织病理学数据集上,对12种模型(包括ResNet(BiT)、Inception、ConvNeXt、ViT和Swin Transformer)进行基准测试,涵盖有监督/自监督预训练与无预训练两种设置。
- 采用基于CycleGAN的图像到图像转换模型生成染色变异图像,并评估模型在分布偏移下的鲁棒性。
- 应用层间相关性传播(LRP)生成归因热力图,并将其与实例分割掩码相关联,以量化在细胞核和背景区域的相关性。
- 提出一种定量指标,通过测量相关性图与分割细胞核之间的重叠程度,评估归因图的合理性。
- 采用滑动窗口方法从全切片图像中生成非重叠的100×100像素图像块,以实现一致的评估。
- 通过多次运行的消融研究(如ViT-L:1至ViT-L:16)分析注意力头的特化与一致性。
实验结果
研究问题
- RQ1哪些深度学习架构在多种组织病理学数据集中实现了最高的分类性能?
- RQ2现代CNN与视觉Transformer在全切片图像中对染色变异的鲁棒性如何?
- RQ3不同模型在多大程度上将其注意力聚焦于生物相关结构(如细胞核)?
- RQ4可解释性方法(如LRP)能否有效扩展至视觉Transformer,并用于定量比较模型决策策略?
- RQ5预训练(有监督或自监督)对组织病理学中模型性能、鲁棒性与可解释性有何影响?
主要发现
- Inception V3(尤其是预训练后)以及微调后的ConvNeXt-L在五个组织病理学数据集中均实现了最高的预测性能。
- 所有模型(包括ViTs和Swin Transformers)在其注意力与归因图中均表现出对细胞核的强烈聚焦,表明与病理科医生关注的特征一致。
- 尽管准确率较高,模型对染色变异的鲁棒性仍不足,当在CycleGAN生成的染色变异图像上测试时,性能显著下降。
- 所提出的基于LRP的量化方法揭示,ViT中的注意力头会将相关性分布于多个细胞核及组织区域,部分注意力头对特定类型的细胞核具有特化性。
- 仅含三个注意力头的ViT-Tiny模型表现出更广泛、更不聚焦的注意力,而ViT-Base与ViT-Large则展现出更精细、以细胞核为中心的注意力模式。
- 所有架构的鲁棒性均表现一致低下,表明染色变异仍是深度学习在病理学中实际部署的主要障碍。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。