[論文レビュー] FluoroSAM: A Language-promptable Foundation Model for Flexible X-ray Image Segmentation
FluoroSAM は、合成 X 線データから訓練された言語整合型の SAM スタイル基盤モデルで、テキストプロンプト、ゼロショット、および点での洗練による X 線画像のセグメンテーションを可能にし、実データのフルオロスコピーデータ上で既存の SAM バリアントを上回り、胸部 X 線画像における全肺セグメンテーションのような unseen タスクにも一般化します。
Language promptable X-ray image segmentation would enable greater flexibility for human-in-the-loop workflows in diagnostic and interventional precision medicine. Prior efforts have contributed task-specific models capable of solving problems within a narrow scope, but expanding to broader use requires additional data, annotations, and training time. Recently, language-aligned foundation models (LFMs) -- machine learning models trained on large amounts of highly variable image and text data thus enabling broad applicability -- have emerged as promising tools for automated image analysis. Existing foundation models for medical image analysis focus on scenarios and modalities where large, richly annotated datasets are available. However, the X-ray imaging modality features highly variable image appearance and applications, from diagnostic chest X-rays to interventional fluoroscopy, with varying availability of data. To pave the way toward an LFM for comprehensive and language-aligned analysis of arbitrary medical X-ray images, we introduce FluoroSAM, a language-promptable variant of the Segment Anything Model, trained from scratch on 3M synthetic X-ray images from a wide variety of human anatomies, imaging geometries, and viewing angles. These include pseudo-ground truth masks for 128 organ types and 464 tools with associated text descriptions. FluoroSAM is capable of segmenting myriad anatomical structures and tools based on natural language prompts, thanks to the novel incorporation of vector quantization (VQ) of text embeddings in the training process. We demonstrate FluoroSAM's performance quantitatively on real X-ray images and showcase on several applications how FluoroSAM is a key enabler for rich human-machine interaction in the X-ray image acquisition and analysis context. Code is available at https://github.com/arcadelab/fluorosam.
研究の動機と目的
- 任意の X 線画像に対して、タスク固有の再訓練なしで自動化されたインタラクティブなセグメンテーションを提供する。
- 重複する X 線構造やあいまいさに対処するため、言語整合型プロンプトのパラダイムを活用する。
- 臓器とデバイスのマスクを含む大規模な合成 X 線データセットを作成し、ゼロから基盤モデルを訓練する。
- 未見の X 線クラスへのゼロショット一般化と、解剖体データおよび胸部 X 線画像での実世界適用性を示す。
提案手法
- 128 の臓器と 464 のデバイスに対する 63M マスクを含む合成 X 線データセット(1.6M DRR)上で、ゼロから SAM スタイルの基盤モデルを訓練する。
- ターゲットを記述しセグメンテーションを導くため、Large Language Model で拡張されたテキストプロンプトを使用する。
- 初期のテキストプロンプトで作成されたマスクを改善するために、ポイントベースの洗練プロンプトを組み込む。
- Frozen の MedCLIP テキスト埋め込みと EfficientViT 画像エンコーダを用い、GPT-3.5 ベースの拡張ループでプロンプト変形を行う。
- 合成と実データのギャップを埋めるために、ドメイン乱数化と sim-to-real 転送技術を適用する。
実験結果
リサーチクエスチョン
- RQ1言語整合型基盤モデルは、テキストプロンプトだけで任意の物体や解剖学的構造を X 線画像でセグメントできるか?
- RQ2点ベースの洗練を取り入れると、実際の X 線データでのセグメンテーション品質は向上するか?
- RQ3胸部 X 線画像での全肺セグメンテーションのような未見の X 線クラス(ゼロショット)へ、モデルはどの程度一般化できるか?
主な発見
- FluoroSAM は、合成テストセットでテキストプロンプトのみの場合 0.43±0.26 Dice を達成し、点ベースの洗練で 0.85±0.11 に改善する。
- 2 点で、FluoroSAM は 0.68±0.20 Dice に達し、MedSAM (0.60±0.22) および SAM (0.58±0.19) を上回る。
- フルオロスコピーを用いた解剖体研究では、硬組織に対してテキストプロンプトは 0.39 Dice、総合で 0.26 を与える一方、ポイントプロンプトを追加すると硬組織で 0.90±0.15、軟組織で 0.73±0.15 となり、SAM/MedSAM のベースラインを上回る。
- 胸部 X 線画像でのゼロショット全肺セグメンテーション(full-lung クラスの訓練なし)は、テキストプロンプトで 0.52±0.21 Dice、ポイント洗練で 0.90±0.04 に上昇する。
- FluoroSAM は、解剖体および胸部 X 線画像を含む実画像において、ゼロショット一般化と対話的洗練能力を示す。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。