[논문 리뷰] One-shot Localization and Segmentation of Medical Images with Foundation Models
이 논문은 사전 학습된 자연 이미지 기반의 기초 모델(ViT 변형 및 Stable Diffusion)이 템플릿 이미지를 이용해 Segment Anything 모델을 안내함으로써 다양한 의료 영상에서 단일 샷 로컬라이제이션 및 세분화를 가능하게 하고, 모달리티 전반에 걸쳐 경쟁력 있는 Dice 점수를 달성하며 대부분의 작업에서 최근의 몇 샷 방법을 능가한다는 것을 보여준다.
Recent advances in Vision Transformers (ViT) and Stable Diffusion (SD) models with their ability to capture rich semantic features of the image have been used for image correspondence tasks on natural images. In this paper, we examine the ability of a variety of pre-trained ViT (DINO, DINOv2, SAM, CLIP) and SD models, trained exclusively on natural images, for solving the correspondence problems on medical images. While many works have made a case for in-domain training, we show that the models trained on natural images can offer good performance on medical images across different modalities (CT,MR,Ultrasound) sourced from various manufacturers, over multiple anatomical regions (brain, thorax, abdomen, extremities), and on wide variety of tasks. Further, we leverage the correspondence with respect to a template image to prompt a Segment Anything (SAM) model to arrive at single shot segmentation, achieving dice range of 62%-90% across tasks, using just one image as reference. We also show that our single-shot method outperforms the recently proposed few-shot segmentation method - UniverSeg (Dice range 47%-80%) on most of the semantic segmentation tasks(six out of seven) across medical imaging modalities.
연구 동기 및 목표
- 사전 학습된 자연 이미지 모델이 도메인 특화 튜닝 없이 의료 영상 대응 작업을 수행할 수 있는지 평가합니다.
- 템플릿 이미지를 사용한 프롬프트를 통해 SAM 모델을 이용한 단일 샷 세분화 파이프라인을 시연합니다.
- 다양한 모달리티(CT, MR, Ultrasound)와 해부 영역에서의 성능을 평가합니다.
- 의료 영상에서 최근의 몇 샷 세분화 방법과 단일 샷 성능을 비교합니다.
제안 방법
- 자연 이미지로 학습된 다양한 ViT 모델(DINO, DINOv2, SAM, CLIP)과 Stable Diffusion 모델을 의료 영상 대응 작업에 대해 평가합니다.
- 템플릿-이미지 대응을 사용하여 Segment Anything 모델을 프롬프트하고 단일 샷 세분화를 얻습니다.
- 여러 모달리티 및 해부 영역에서 Dice 점수를 보고 일반화를 평가합니다.
- 제안된 단일 샷 방법을 의료 영상의 의미적 세분화 작업에서 UniverSeg(몇 샷)와 비교합니다.
- 교차 모달리티 및 교차 제조사 로버스트니스를 입증하는 결과를 제시합니다.
실험 결과
연구 질문
- RQ1자연 이미지로 학습된 파운데이션 모델이 도메인 특화 미세 조정 없이 의료 영상 대응 작업을 수행할 수 있는가?
- RQ2템플릿 이미지로 안내하는 프롬프트 방식이 의료 영상에서 정확한 단일 샷 세분화를 얻을 수 있는가?
- RQ3단일 샷 세분화 성능이 모달리티 및 작업 전반에서 최근의 몇 샷 방법과 어떻게 비교되는가?
주요 결과
- 자연 이미지 기초 모델과 템플릿 프롬프트를 활용한 단일 샷 로컬라이제이션 및 세분화는 작업 전반에서 Dice 점수가 62%–90% 범위로 나타난다.
- 이 방법은 세분화를 위해 SAM을 프롬프트하는 데에 하나의 참조 이미지만 사용합니다.
- 대부분의 모달리티에서의 의미적 세분화 작업에서(총 일곱 개 중 여섯 개) 단일 샷 방법이 몇 샷 UniverSeg 방식(Dice 범위 47%–80%)보다 우수하게 나타난다.
- 실험은 다양한 제조사의 뇌, 흉부, 복부, 사지에서 CT, MR, Ultrasound를 다룬다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.