Skip to main content
QUICK REVIEW

[論文レビュー] Learnable Ophthalmology SAM

Zhongxi Qiu, Yan Hu|arXiv (Cornell University)|Apr 26, 2023
Retinal Imaging and Analysis被引用数 12
ひとこと要約

この論文は Segment Anything (SAM) の学習可能な prompt 層を導入し、 backbone を凍結し、タスク特化の prompt と head を訓練することで、ワンショットかつ多モーダルな眼科画像分割を可能にする。複数の眼科タスクとデータセットで分割性能を改善し、一般化が強いことを示す。

ABSTRACT

Segmentation is vital for ophthalmology image analysis. But its various modal images hinder most of the existing segmentation algorithms applications, as they rely on training based on a large number of labels or hold weak generalization ability. Based on Segment Anything (SAM), we propose a simple but effective learnable prompt layer suitable for multiple target segmentation in ophthalmology multi-modal images, named Learnable Ophthalmology Segment Anything (SAM). The learnable prompt layer learns medical prior knowledge from each transformer layer. During training, we only train the prompt layer and task head based on a one-shot mechanism. We demonstrate the effectiveness of our thought based on four medical segmentation tasks based on nine publicly available datasets. Moreover, we only provide a new improvement thought for applying the existing fundamental CV models in the medical field. Our codes are available at \href{https://github.com/Qsingle/LearnablePromptSAM}{website}.

研究の動機と目的

  • 多モーダルな画像と限られたラベルに伴い、眼科領域での分割を促進する。
  • SAMのトランスフォーマーブロック間に挿入する学習可能なprompt層を提案し、医療的事前知識を注入する。
  • プロンプト層とタスクヘッドのみを訓練してワンショット微調整を実現する。
  • 複数のタスク(血管、病変、視網膜層)とデータセットで有効性を示す。
  • データセット間のゼロショット実験を通じて一般化を評価する。

提案手法

  • SAMのバックボーンを凍結しつつ、各トランスフォーマーブロックの間に学習可能なprompt層を挿入する。
  • 各Prompt_iを形成するために、LayerNormと GELU を用いた2つの1x1畳み込みと、深さ方向の3x3畳み込みを使用する。
  • i-番目のトランスフォーマー入力特徴量から prompts を Compute する式 Prompt_i = delta(LN(W1(delta(LN(DW3(delta(LN(W1(fi))))))))).
  • アップサンプリングとマルチスケール畳み込みを用いてセグメンテーションマップを生成するタスク特化のヘッドを接続する。
  • ワンショット機構でプロンプト層とタスクヘッドだけを訓練する。
  • 9つの公開データセットを用いて3つのセグメンテーションタスク(血管、病変、視網膜層)を評価し、Dice、Precision、Recall、BM、IoU などの指標を用いる。

実験結果

リサーチクエスチョン

  • RQ1学習可能な prompt 層は、フルファインチューニングなしに SAM が多モーダル画像の眼科特有のターゲットを分割できるか?
  • RQ2提案された prompt がデータセットとモダリティを跨って医療事前知識を一般化できるか?
  • RQ3医療分野の分割における prompts およびヘッドのワンショット訓練は、フルファインチューニングやヘッドのみのチューニングとどう比較されるか?
  • RQ4血管、病変、視網膜層の分割タスクにおける手法の性能と一般化は?

主な発見

  • 学習可能な眼科用 prompt は、ワンショット微調整で複数のタスクで競争力のあるまたは改善された分割性能を示す。
  • ゼロショットのテストでは、あるデータセットで訓練された prompts が他の二モーダル血管分割データセットおよびメーカーの異なる OCTA データセットに良く一般化する。
  • OCT 視網膜層分割(ARoI)で Dice はベースライン SAM より約25%向上する。
  • 本手法は OCTA の大血管を分割したり、視網膜層分割を SAM 単独よりも効果的に行えるケースが多い。
  • 小さなターゲットは SAM ベースの prompts では依然として難しく、極小オブジェクトのためのさらなる prompt 強化が必要である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。