Skip to main content
QUICK REVIEW

[論文レビュー] SAM3D: Segment Anything Model in Volumetric Medical Images

Nhat-Tan Bui, Dinh-Hieu Hoang|arXiv (Cornell University)|Sep 7, 2023
Radiomics and Machine Learning in Medical ImagingMedicine被引用数 3
ひとこと要約

SAM3Dは、2次元スライスをまず処理し、その後に3次元デコーダーを用いて深さ方向の関係を捉えることで、事前学習済みのSAMエンコーダーをボリュメトリックデータに適用する軽量で効率的な3次元医療画像セグメンテーションモデルを提案する。わずか188万パラメータで最先端の性能を達成し、他のSAMベースおよびSOTAモデルを上回るセグメンテーション精度を実現しながら、モデルの複雑さを顕著に低減している。

ABSTRACT

Image segmentation remains a pivotal component in medical image analysis, aiding in the extraction of critical information for precise diagnostic practices. With the advent of deep learning, automated image segmentation methods have risen to prominence, showcasing exceptional proficiency in processing medical imagery. Motivated by the Segment Anything Model (SAM)-a foundational model renowned for its remarkable precision and robust generalization capabilities in segmenting 2D natural images-we introduce SAM3D, an innovative adaptation tailored for 3D volumetric medical image analysis. Unlike current SAM-based methods that segment volumetric data by converting the volume into separate 2D slices for individual analysis, our SAM3D model processes the entire 3D volume image in a unified approach. Extensive experiments are conducted on multiple medical image datasets to demonstrate that our network attains competitive results compared with other state-of-the-art methods in 3D medical segmentation tasks while being significantly efficient in terms of parameters. Code and checkpoints are available at https://github.com/UARK-AICV/SAM3D.

研究の動機と目的

  • 従来の3次元医療画像セグメンテーションモデルが抱える、複雑なアーキテクチャと高いパラメータ数の制限を解消すること。
  • 完全なモデルの微調整を伴わずに、Segment Anything Model (SAM) の能力をボリュメトリック医療画像に拡張すること。
  • スライスごとに独立して処理するのではなく、スライス間の3次元空間的関係を捉えることで、セグメンテーション性能を向上させること。
  • 計算効率が高く、パラメータが少ないフレームワークを構築し、3次元医療画像セグメンテーションにおいて高い精度を維持すること。

提案手法

  • 自然画像からのエッジや境界といった強力な低レベル特徴を保持できるように、事前学習済みのSAM画像エンコーダー(ViT-B)を凍結する。
  • 3次元ボリュームの各2次元スライスを、凍結されたSAMエンコーダーを介して個別に処理し、$ \frac{H}{16} \times \frac{W}{16} \times D \times 256 $ の形状の3次元スライス埋め込みを生成する。
  • スライス埋め込み間の深さ方向の関係をモデル化するため、軽量な3次元畳み込みデコーダーを適用し、3次元の文脈理解を可能にする。
  • モデリングのバイアスを避けるために、SAMのプロンプトエンコーダーを削除し、多様な医療画像モodalitiesにわたる一般化を確保する。
  • SAMエンコーダーを凍結したまま、3次元デコーダーのヘッドのみをエンドツーエンドで学習し、パラメータ更新と計算コストを最小限に抑える。
  • 3次元デコーダーにスキップ接続を組み込み、細粒度の特徴を保持し、セグメンテーションにおけるエッジや境界の局所化を向上させる。

実験結果

リサーチクエスチョン

  • RQ1完全な微調整を伴わずに、SAMのような事前学習済み2次元基盤モデルを3次元ボリュメトリック医療画像セグメンテーションに効果的に適応できるか?
  • RQ23次元デコーダーを用いてスライス間の関係を捉えることで、スライスごとの処理に比べてセグメンテーション性能が向上するか?
  • RQ3軽量な3次元デコーダーは、既存のSOTA 3次元セグメンテーションモデルと比較して、はるかに少ないパラメータで競争力のある結果を達成できるか?
  • RQ4マルチモodalな3次元医療データセットにおいて、SAM3Dは他のSAMベースおよびTransformer/CNNハイブリッドモデルと比較して、性能と効率の両面で優れているか?

主な発見

  • Synapseデータセットでは、188万パラメータでDSCが77.78%に達し、632万パラメータのSAMed_sを1.78%上回った。
  • ACDC心臓データセットでは、50分の1未満のパラメータ数でTransUNetを0.41%上回るDSCを達成した。
  • BraTS脳腫瘍データセットでは、UNetR よりも1.8%高いDSCを達成し、パラメータ数は20分の1未満であった。
  • アブレーションスタディの結果、3次元デコーダー内のスキップ接続が性能向上に寄与しており、境界の詳細を保持する役割を果たしていることが確認された。
  • 心臓、脳、肺のセグメンテーションタスクを含む多様なモダリティや解剖的構造にわたり、強力な一般化性能を示した。
  • 最小のSAMバージョン(ViT-B)を用いても性能が競争力を持つことから、より大きなバックボーンバージョン(例:ViT-L, ViT-H)を用いることでさらなる向上が期待できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。