Skip to main content
QUICK REVIEW

[論文レビュー] A Clinical Benchmark of Public Self-Supervised Pathology Foundation Models

Gabriele Campanella, Shengjia Chen|arXiv (Cornell University)|Jul 9, 2024
Ethics in Clinical Research被引用数 6
ひとこと要約

この論文は、自己教師あり学習で訓練された公的病理ファウンデーションモデルを臨床の複数機関データセットでベンチマークし、疾病検出とバイオマーカー予測タスクにおける性能とリソース使用を比較します。スケーリング挙動とデータセット効果を分析し、モデル選択と将来のベンチマーク作成の指針を提供します。

ABSTRACT

The use of self-supervised learning (SSL) to train pathology foundation models has increased substantially in the past few years. Notably, several models trained on large quantities of clinical data have been made publicly available in recent months. This will significantly enhance scientific research in computational pathology and help bridge the gap between research and clinical deployment. With the increase in availability of public foundation models of different sizes, trained using different algorithms on different datasets, it becomes important to establish a benchmark to compare the performance of such models on a variety of clinically relevant tasks spanning multiple organs and diseases. In this work, we present a collection of pathology datasets comprising clinical slides associated with clinically relevant endpoints including cancer diagnoses and a variety of biomarkers generated during standard hospital operation from two medical centers. We leverage these datasets to systematically assess the performance of public pathology foundation models and provide insights into best practices for training new foundation models and selecting appropriate pretrained models.

研究の動機と目的

  • 臨床的に関連するタスクを横断する複数の臓器と疾患における公的病理ファウンデーションモデルの性能を評価する。
  • 異なるSSLアルゴリズムとデータセットで訓練されたモデルを比較し、訓練とモデル選択のベストプラクティスを特定する。
  • モデルサイズと訓練リソースが下流の臨床タスク性能にどのように関連するかを評価する。
  • 計算病理における将来のモデル開発のためのライブベンチマークと指針を提供する。

提案手法

  • 与えられたファウンデーションモデルを用いて、スライドレベルの組織タイル(20x)を特徴表現に埋め込む。
  • Gated MIL Attention (GMA) と線形分類器を用いてタイル特徴を統合し、スライドレベルの予測を行う。
  • 各折りについて80%を訓練、20%を検証とする20回折のモンテカルロ交差検証を用いて一般化を推定する。
  • AdamW最適化手法、暖機付きコサイン減衰、タスク/モデルあたり50エポックで訓練する。
Figure 1: Benchmarking Results: Detection Tasks.
Figure 1: Benchmarking Results: Detection Tasks.

実験結果

リサーチクエスチョン

  • RQ1公的病理ファウンデーションモデルは、臓器および癌種を横断する疾病検出とバイオマーカー予測でどのように比較されるか?
  • RQ2前学習データの規模とアーキテクチャが病理学の下流臨床タスク性能に与える影響は何か?
  • RQ3より大きなモデルはバイオマーカー予測タスクの性能を一貫して向上させるのか、前学習データの構成はこの点にどう影響するのか?
  • RQ4計算資源と訓練コストは病理SSLモデルの下流性能にどのように関連するか?
  • RQ5標準化されたライブベンチマークは臨床展開のモデル選択を効果的に導くことができるのか?

主な発見

  • DINOおよびDINOv2で訓練されたモデルは検出タスクで比較可能な性能を示し、ImageNetまたはCTransPathで事前学習したエンコーダは平均して劣る。
  • 検出タスクでは、モデルサイズのスケーリング効果はほとんど見られず、小型モデル(SP21M/SP22M)はこれらのタスクで大きなモデルと同等の性能を示す。
  • バイオマーカー予測タスクはよりばらつきが大きく、UNIとProv-GigaPathが他を上回ることが多く、特に組織表現が前学習データと一致する場合(例:肺)に顕著。
  • ICI応答などのアウトカム予測はモデル間で依然として困難で、NSCLCコホートでAUCは偶然並み。
  • 前学習データの構成はバイオマーカーの性能に大きく影響し得ることを示唆しており、前学習データの組成がタスク結果に影響を及ぼす。
  • より大きなモデルは一部のバイオマーカータスクで役立つ可能性があるが、利益はタスク依存で、データ組成により混同される可能性がある。
  • すべての検証モデルで、計算資源の増大が検出またはバイオマーカー予測の下流タスク性能を普遍的に向上させるわけではなかった。
Figure 2: Benchmarking Results: Biomarker Prediction Tasks.
Figure 2: Benchmarking Results: Biomarker Prediction Tasks.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。