[論文レビュー] DeepSMILE: Self-supervised heterogeneity-aware multiple instance learning for DNA damage response defect classification directly from H&E whole-slide images
DeepSMILE は自己教師あり、異質性に配慮した複数インスタンス学習フレームワークであり、ピクセルレベルやタイルレベルのアノテーションを一切必要とせず、H&E 全スライド画像から DNA 損傷応答障害—相同鎖再結合障害(HRD)およびマイクロサテライト不安定性(MSI)—を直接分類する。対照的自己教師あり事前学習と変動に配慮した深層複数インスタンス学習を組み合わせることで、多施設の乳がんおよび大腸がんデータセットにおいて、HRD では 83.79±1.25%、MSI では 90.32±3.58% の AUC 性能を向上させた。
We propose a Deep learning-based weak label learning method for analysing whole slide images (WSIs) of Hematoxylin and Eosin (H&E) stained tumorcells not requiring pixel-level or tile-level annotations using Self-supervised pre-training and heterogeneity-aware deep Multiple Instance LEarning (DeepSMILE). We apply DeepSMILE to the task of Homologous recombination deficiency (HRD) and microsatellite instability (MSI) prediction. We utilize contrastive self-supervised learning to pre-train a feature extractor on histopathology tiles of cancer tissue. Additionally, we use variability-aware deep multiple instance learning to learn the tile feature aggregation function while modeling tumor heterogeneity. Compared to state-of-the-art genomic label classification methods, DeepSMILE improves classification performance for HRD from $70.43\pm4.10\%$ to $83.79\pm1.25\%$ AUC and MSI from $78.56\pm6.24\%$ to $90.32\pm3.58\%$ AUC in a multi-center breast and colorectal cancer dataset, respectively. These improvements suggest we can improve genomic label classification performance without collecting larger datasets. In the future, this may reduce the need for expensive genome sequencing techniques, provide personalized therapy recommendations based on widely available WSIs of cancer tissue, and improve patient care with quicker treatment decisions - also in medical centers without access to genome sequencing resources.
研究の動機と目的
- ピクセルやタイルレベルの詳細なアノテーションを必要とせず、H&E 全スライド画像からがんの遺伝子欠損を弱教師付き深層学習で分類する手法を開発すること。
- 分類の過程でタイルレベル特徴量の変動をモデル化することで、組織病理学的画像における腫瘍の異質性に対処すること。
- ラベルなしの組織病理学的タイルで自己教師あり事前学習を用いることで、遺伝子ラベル分類性能を向上させること。
- ゲノムシークエンシングが利用できないリソース制限のある環境でも、HRD および MSI の正確な予測を可能にすること。
- 広く利用可能な H&E 染色全スライド画像を活用することで、高価なゲノムシークエンシングへの依存を減らし、個別化治療の推奨に貢献すること。
提案手法
- H&E 染色全スライド画像の組織病理学的タイルを用いて、対照的自己教師あり学習により特徴抽出器を事前学習する。
- 腫瘍の空間的変動をモデル化しながら、タイルレベル特徴量を統合する異質性に配慮した深層複数インスタンス学習(MIL)フレームワークを適用する。
- ピクセルやタイルレベルのアノテーションを一切必要とせず、弱いスライドレベルラベル(例:HRD や MSI 状態)を用いてエンドツーエンドの学習を実施する。
- 全スライド画像内のタイル間で特徴量の変動を考慮する学習可能な集約関数を採用する。
- 一般化を確保するため、乳がんおよび大腸がんの全スライド画像からなる多施設データセットを用いてモデルを学習する。
- 自己教師あり事前学習段階で、対照的なデータオーグメンテーションから特徴を判別可能に学習するシアンズ型ネットワークアーキテクチャを採用する。
実験結果
リサーチクエスチョン
- RQ1ラベルなしの組織病理学的タイルで自己教師あり事前学習を実施することで、HRD や MSI の下流の遺伝子ラベル分類性能が向上するか?
- RQ2変動に配慮した MIL フレームワークにより腫瘍の異質性をモデル化することで、標準的な MIL アプローチと比較して分類精度が向上するか?
- RQ3ピクセルレベルのアノテーションを一切必要としない弱教師付き深層学習モデルが、HRD や MSI 予測において高い AUC を達成できるか、その程度はいかほどか?
- RQ4提案手法は、染色法や画像取得プロトコルが多様な多施設データセットにも一般化可能か?
- RQ5自己教師あり学習と異質性に配慮した MIL の統合により、臨床意思決定における高価なゲノムシークエンシングへの依存が低下するか?
主な発見
- DeepSMILE は多施設の乳がんデータセットにおいて、HRD 分類の AUC を 70.43±4.10% から 83.79±1.25% まで向上させた。
- 大腸がんデータセットでは、MSI 予測の AUC を 78.56±6.24% から 90.32±3.58% まで向上させた。
- より大きなアノテート済みデータセットを収集することなく、自己教師あり事前学習の有効性を実証した。
- モデルは多施設データセットに一般化可能であり、染色法や画像取得プロトコルのばらつきに対しても頑健であることが示された。
- フレームワークにより、標準的な H&E WSI から直接遺伝子欠損を正確に分類可能となり、高価なゲノムシークエンシングへの依存が低減された。
- 結果から、DeepSMILE はゲノムシークエンシングにアクセスできない臨床現場において、個別化治療の推奨を支援できる可能性を示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。