Skip to main content
QUICK REVIEW

[論文レビュー] When is a Foundation Model a Foundation Model

Saghir Alfasly, Peyman Nejat|arXiv (Cornell University)|Sep 14, 2023
AI in cancer detection被引用数 5
ひとこと要約

この論文は、CLIP やその変種のような基礎モデル(FMs)が、デジタル病理学において従来のディープニューラルネットワークを実際に上回っているかどうかを調査している。巨大なスケールと膨大なデータへの事前学習にもかかわらず、PLIP や BiomedCLIP といったモデルは、KimiaNet や DinoSSLPath といったより小さい、タスクに特化したネットワークに劣ることがあり、全スライド画像(WSI)検索タスクにおいて、ヒストパスロジー表現学習においてモデルのサイズよりもデータの質とドメイン特化型のファインチューニングの重要性が顕著であることを示している。

ABSTRACT

Recently, several studies have reported on the fine-tuning of foundation models for image-text modeling in the field of medicine, utilizing images from online data sources such as Twitter and PubMed. Foundation models are large, deep artificial neural networks capable of learning the context of a specific domain through training on exceptionally extensive datasets. Through validation, we have observed that the representations generated by such models exhibit inferior performance in retrieval tasks within digital pathology when compared to those generated by significantly smaller, conventional deep networks.

研究の動機と目的

  • 多様で臨床的でないデータソース(例:ソーシャルメディア)から事前学習された基礎モデルが、ヒストパスロジー表現学習において従来のディープニューラルネットワークを上回るかどうかを評価すること。
  • CLIP、BiomedCLIP、PLIP などの基礎モデルが、患者マッチングのための全スライド画像(WSI)検索においてどれほど効果的であるかを評価すること。
  • 高品質で臨床的な病理学データに特化して学習された、より小さいタスク特化型モデル(例:KimiaNet、DinoSSLPath)と基礎モデルの性能を比較すること。
  • WSI対WSIマッチングの下流タスクにおける精度を測定した際、'基礎モデル'というラベルが正当化されるかどうかを調査すること。
  • データの質とドメイン特化性が、最適なデジタル病理学の表現を達成するためのモデルスケールや事前学習範囲を上回る要因であるかどうかを特定すること。

提案手法

  • 公共の病理学コミュニティやオンラインソースからのヒストロジー画像を用いて、基礎モデルであるCLIP、BiomedCLIP、PLIPをファインチューニングした。
  • TCGAリポジトリを用いて、教師あり学習を用いたKimiaNet(DenseNetベース)と自己教師あり学習を用いたDinoSSLPath(ビジョントランスフォーマーベース)を訓練した。
  • CLIP、BiomedCLIP、PLIP、DinoSSLPath、KimiaNet を用いて、全スライド画像(WSIs)からピクセルレベルの特徴を抽出した。
  • Yottixel検索エンジンを用い、'モザイク'ピッチングと'最小値の中央値'マッチングを適用して、WSI対WSIの検索を実行した。
  • 内部および公開データセットの両方で、1人を除いた交差検証(leave-one-patient-out)とF1スコア(MV@k)を用いて性能を評価した。
  • MV@k(上位k個の検索結果における多数決)を用いて平均F1スコアを算出し、精度と再現率の両方を組み込んだ。

実験結果

リサーチクエスチョン

  • RQ1非臨床的でインターネット由来のヒストパスロジー画像でファインチューニングされた基礎モデルは、WSI対WSI検索において従来のディープニューラルネットワークを上回るのか?
  • RQ2基礎モデルの性能が、その事前学習データの質と臨床的関連性によって制限されているのか?
  • RQ3KimiaNet や DinoSSLPath といったより小さいタスク特化型モデルが、ヒストパスロジーの表現学習において基礎モデルを上回ることができるのか?
  • RQ4医療画像における真の基礎モデルと呼ぶにふさわしい条件とは何か—性能か、データの質か?
  • RQ5下流診断タスクにおいて、より小さいドメイン特化型モデルに劣る性能を示す場合、'基礎モデル'というラベルは正当性を有するのか?

主な発見

  • KimiaNet は内部の皮膚がんデータセットで最高のトップ1正答率(78%)を達成し、PLIP(63%)やCLIP(62%)といったすべての基礎モデルを上回った。
  • DinoSSLPath は内部の肝疾患データセットで最高の性能を示し、トップ1正答率が65%に達し、PLIP(59%)やBiomedCLIP(59%)を上回った。
  • 公開のDigestPath CTSデータセットでは、DinoSSLPath が最高のMV@5スコア(91.5%)を記録し、PLIP(84.1%)やBiomedCLIP(87.2%)を上回った。
  • 公開のDigestPath SRCCデータセットでは、DinoSSLPath がMV@5スコア98.8%を達成し、PLIP(90.8%)やBiomedCLIP(95.4%)を顕著に上回った。
  • 内部データセット全体では、KimiaNet が最高の総合F1スコア(65% ± 6%)を達成し、PLIP(60% ± 6%)やCLIP(55% ± 10%)を上回った。
  • 公開データセットでは、DinoSSLPath が最高の総合F1スコア(82.3% ± 22%)を記録し、PLIP(79.1% ± 23%)やBiomedCLIP(78.7% ± 22%)を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。