Skip to main content
QUICK REVIEW

[論文レビュー] From Modern CNNs to Vision Transformers: Assessing the Performance, Robustness, and Classification Strategies of Deep Learning Models in Histopathology

Maximilian Springenberg, Annika Frommholz|arXiv (Cornell University)|Apr 11, 2022
AI in cancer detection被引用数 6
ひとこと要約

この論文は、ConvNeXt や Inception などの現代的な CNN から、ビジョン Transformer (ViT および Swin Transformer) までを含む最先端の深層学習モデルを組織病理学分野で評価し、性能、染色変動に対するロバストネス、解釈可能性を検証している。本研究では、CycleGAN を用いた染色ロバストネス評価のための新規手法を提案し、層別関連度プロパゲーション (LRP) を拡張して核への注目度を定量化した。その結果、すべてのモデルが核を優先的に注目しているものの、戦略的な差異が存在し、アーキテクチャのいかんに関わらず、ロバストネスの欠如が顕著な課題であることが明らかになった。

ABSTRACT

While machine learning is currently transforming the field of histopathology, the domain lacks a comprehensive evaluation of state-of-the-art models based on essential but complementary quality requirements beyond a mere classification accuracy. In order to fill this gap, we developed a new methodology to extensively evaluate a wide range of classification models, including recent vision transformers, and convolutional neural networks such as: ConvNeXt, ResNet (BiT), Inception, ViT and Swin transformer, with and without supervised or self-supervised pretraining. We thoroughly tested the models on five widely used histopathology datasets containing whole slide images of breast, gastric, and colorectal cancer and developed a novel approach using an image-to-image translation model to assess the robustness of a cancer classification model against stain variations. Further, we extended existing interpretability methods to previously unstudied models and systematically reveal insights of the models' classifications strategies that can be transferred to future model architectures.

研究の動機と目的

  • 精度以外の要因、すなわちロバストネスと解釈可能性を含めた、組織病理学分野における最新の深層学習モデルの包括的評価を目的とする。
  • 特にビジョン Transformer を含む最先端モデルが、多様ながん種にわたる多様な組織病理学的データセットにおいて、どの程度の性能を示すかを評価すること。
  • 画像対画像変換 (CycleGAN) を用いて、染色変動に対するモデルのロバストネスを評価するための新規な定量的手法を開発・適用すること。
  • 解釈可能性手法 (LRP) を従来の研究では対象とされていなかったモデルに拡張し、生物学的に重要な領域(例:核)への注目度を定量化すること。
  • 臨床現場への深層学習のデプロイメントを支援するための実行可能なモデル推薦と、再利用可能な評価フレームワークを提供すること。

提案手法

  • ResNet (BiT)、Inception、ConvNeXt、ViT、Swin Transformer を含む 12 種類のモデルを、5 つの公開組織病理学データセット上で、教師あり/自己教師あり事前学習あり・なしの両状態でベンチマーク化した。
  • 画像対画像変換モデルである CycleGAN を用いて染色変更画像を生成し、分布シフト下でのモデルのロバストネスを評価した。
  • 層別関連度プロパゲーション (LRP) を適用してアトリビューションヒートマップを生成し、それらをインスタンスセグメンテーションマスクと相関させて、核および背景領域における関連度を定量化した。
  • 関連度マップとセグメンテーションされた核との重複度を測定することで、アトリビューションマップの妥当性を評価する定量的指標を提案した。
  • 一貫性のある評価を実現するため、全スライド画像から重複のない 100×100 パッチをスライディングウィンドウ法で生成した。
  • 複数回の実験(例:ViT-L:1 から ViT-L:16)を実施し、アテンションヘッドの特化と一貫性を分析するためのアブレーションスタディを実施した。

実験結果

リサーチクエスチョン

  • RQ1どの深層学習アーキテクチャが、多様な組織病理学的データセットで最高の分類性能を達成するか?
  • RQ2現代の CNN およびビジョン Transformer は、全スライド画像における染色変動に対してどの程度ロバストか?
  • RQ3異なるモデルは、細胞核などの生物学的に重要な構造に対してどの程度の注目度を示すか?
  • RQ4LRP などの解釈可能性手法は、ビジョン Transformer に対しても効果的に拡張可能であり、モデルの意思決定戦略を定量的に比較するのに有効か?
  • RQ5事前学習(教師ありまたは自己教師あり)は、組織病理学におけるモデルの性能、ロバストネス、解釈可能性にどのような影響を与えるか?

主な発見

  • Inception V3(特に事前学習済みの場合)および微調整された ConvNeXt-L が、5 つの組織病理学的データセット全体で最高の予測性能を示した。
  • すべてのモデル、特に ViT や Swin Transformer で、注目度とアトリビューションマップにおいて細胞核を強く注目していることが確認され、病理医が関心を持つ特徴と整合していることが示された。
  • 高い精度を示したにもかかわらず、モデルは染色変動に対して十分なロバストネスを示さず、CycleGAN で生成された染色変更画像でのテストでは性能が著しく低下した。
  • 提案された LRP を用いた定量化手法により、ViT のアテンションヘッドが複数の核および組織領域にわたって関連度を分散させていることが明らかになった。一部のヘッドは特定の核タイプに特化していた。
  • アテンションヘッドがわずか 3 個の ViT-Tiny モデルは、広範囲にわたる、焦点がぼんやりとした注目度を示したが、ViT-Base や ViT-Large はより洗練され、核中心の注目度パターンを示した。
  • すべてのアーキテクチャにおいて一貫してロバストネスが低く、染色変動が病理学における深層学習の実用的デプロイメントの主要な障壁のままであることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。