Skip to main content
QUICK REVIEW

[논문 리뷰] FluoroSAM: A Language-promptable Foundation Model for Flexible X-ray Image Segmentation

Benjamin D. Killeen, Liam J. Wang|arXiv (Cornell University)|2024. 03. 12.
Radiomics and Machine Learning in Medical Imaging인용 수 6
한 줄 요약

FluoroSAM은 합성 X선 데이터로 학습된 언어-정렬된 SAM-스타일 기초 모델로, 텍스트 프롬프트, 제로샷 및 포인트 정제로 X선 이미지의 분할을 가능하게 하며, 실제 형촬영 X선 데이터에서 기존의 SAM 변형들을 능가하고 흉부 X선에서 전체 폐 분할과 같은 보지 못한 작업으로도 일반화합니다.

ABSTRACT

Language promptable X-ray image segmentation would enable greater flexibility for human-in-the-loop workflows in diagnostic and interventional precision medicine. Prior efforts have contributed task-specific models capable of solving problems within a narrow scope, but expanding to broader use requires additional data, annotations, and training time. Recently, language-aligned foundation models (LFMs) -- machine learning models trained on large amounts of highly variable image and text data thus enabling broad applicability -- have emerged as promising tools for automated image analysis. Existing foundation models for medical image analysis focus on scenarios and modalities where large, richly annotated datasets are available. However, the X-ray imaging modality features highly variable image appearance and applications, from diagnostic chest X-rays to interventional fluoroscopy, with varying availability of data. To pave the way toward an LFM for comprehensive and language-aligned analysis of arbitrary medical X-ray images, we introduce FluoroSAM, a language-promptable variant of the Segment Anything Model, trained from scratch on 3M synthetic X-ray images from a wide variety of human anatomies, imaging geometries, and viewing angles. These include pseudo-ground truth masks for 128 organ types and 464 tools with associated text descriptions. FluoroSAM is capable of segmenting myriad anatomical structures and tools based on natural language prompts, thanks to the novel incorporation of vector quantization (VQ) of text embeddings in the training process. We demonstrate FluoroSAM's performance quantitatively on real X-ray images and showcase on several applications how FluoroSAM is a key enabler for rich human-machine interaction in the X-ray image acquisition and analysis context. Code is available at https://github.com/arcadelab/fluorosam.

연구 동기 및 목표

  • 임의의 X선 영상에 대해 태스크별 재학습 없이 자동화된 및 대화형 분할을 제공한다.
  • 겹치는 X선 구조와 모호성을 처리하기 위해 언어 정렬 프롬프트 패러다임을 활용한다.
  • 대장기 및 장치 마스크를 포함하는 대규모 합성 X선 데이터셋을 구축하여 기초 모델을 처음부터 학습한다.
  • 보지 못한 X선 클래스에 대한 제로샷 일반화와 시체 데이터 및 흉부 X선에서의 실제 적용 가능성을 입증한다.

제안 방법

  • 합성 X선 데이터셋(1.6M DRR)에서 63M 마스크를 포함해 128개의 기관 및 464개의 장치를 대상으로 SCR형 SAM 스타일의 기초 모델을 처음부터 학습한다.
  • 대형 언어 모델로 보강된 텍스트 프롬프트를 사용하여 대상물을 설명하고 분할을 안내한다.
  • 초기 텍스트 프례트에서의 마스크를 개선하기 위해 포인트 기반 정제 프롬프트를 도입한다.
  • MedCLIP 텍스트 임베딩(고정)과 EfficientViT 이미지 인코더를 활용하고, 프롬프트 변형을 위한 GPT-3.5 기반 증강 루프를 적용한다.
  • 합성-실제 격차를 해소하기 위해 도메인 무작위화 및 시뮬레이션-현실 전이 기술을 적용한다.

실험 결과

연구 질문

  • RQ1언어-정렬 기초 모델이 텍스트 프롬프트만으로 X선 이미지의 임의 객체 및 해부학을 분할할 수 있는가?
  • RQ2포인트 기반 정za인을 도입하면 실제 X선 데이터의 분할 품질이 향상되는가?
  • RQ3모델이 보지 못한 X선 클래스(제로샷)에 얼마나 일반화할 수 있는가(흉부 X선에서 전체 폐 분할과 같은 경우)?

주요 결과

  • FluoroSAM은 텍스트 프롬프트만으로 합성 테스트 세트에서 0.43±0.26 Dice를 달성하고, 포인트 기반 정제를 통해 0.85±0.11로 향상된다.
  • 두 점으로는 FluoroSAM이 0.68±0.20 Dice에 도달하여 MedSAM(0.60±0.22) 및 SAM(0.58±0.19)을 능가한다.
  • 형촬영 시체 연구에서 텍스트 프롬프트는 경조직에 대해 0.39 Dice, 전체적으로 0.26을 보이며, 포인트 프롬프트를 추가하면 경조직에서 0.90±0.15, 연조직에서 0.73±0.15로 향상되어 (SAM/MedSAM 벤치마크보다 우수)
  • 가슴 X선에서 전체 폐 클래스로의 훈련 없이 제로샷 전체 폐 분할이 텍스트 프롬프트로 0.52±0.21 Dice를 달성하고 포인트 정제에서 0.90±0.04로 상승한다.
  • FluoroSAM은 실제 X선 이미징에서 제로샷 일반화와 대화형 정제 기능을 시체 및 흉부 X선 시나리오를 포함하여 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.