Skip to main content
QUICK REVIEW

[논문 리뷰] Zero-shot performance of the Segment Anything Model (SAM) in 2D medical imaging: A comprehensive evaluation and practical guidelines

Christian Mattjie, Luís Vinícius de Moura|arXiv (Cornell University)|2023. 04. 28.
Artificial Intelligence in Healthcare and Education인용 수 6
한 줄 요약

이 논문은 X-ray, 초음파, 피부내시경, 대장내시경 4가지 모odalities에서 얻은 6개 데이터셋을 대상으로, 세그먼트 애니원드 모델(SAM)의 2D 의료 영상에서의 제로샷 성능을 평가한다. 제안된 실용적이고 최소 상호작용이 필요한 프롬프팅 프레임워크는 경계상자 프롬프트로 시작하여 점 프롬프트로 정밀 조정함으로써, 최소한의 사용자 입력으로 최신 기술 수준 또는 그 이상의 성능을 달성하며, 미세조정 없이도 SAM의 뛰어난 일반화 능력과 임상적 유용성을 입증한다.

ABSTRACT

Segmentation in medical imaging is a critical component for the diagnosis, monitoring, and treatment of various diseases and medical conditions. Presently, the medical segmentation landscape is dominated by numerous specialized deep learning models, each fine-tuned for specific segmentation tasks and image modalities. The recently-introduced Segment Anything Model (SAM) employs the ViT neural architecture and harnesses a massive training dataset to segment nearly any object; however, its suitability to the medical domain has not yet been investigated. In this study, we explore the zero-shot performance of SAM in medical imaging by implementing eight distinct prompt strategies across six datasets from four imaging modalities, including X-ray, ultrasound, dermatoscopy, and colonoscopy. Our findings reveal that SAM's zero-shot performance is not only comparable to, but in certain cases, surpasses the current state-of-the-art. Based on these results, we propose practical guidelines that require minimal interaction while consistently yielding robust outcomes across all assessed contexts. The source code, along with a demonstration of the recommended guidelines, can be accessed at https://github.com/Malta-Lab/SAM-zero-shot-in-Medical-Imaging.

연구 동기 및 목표

  • 다양한 2D 의료 영상 모달리티에서 세그먼트 애니원드 모델(SAM)의 제로샷 일반화 능력을 평가하는 것.
  • 최소한의 사용자 상호작용으로 분할 정확도를 극대화하는 효과적인 프롬프팅 전략을 규명하는 것.
  • 의사들이 임상 워크플로우에서 SAM을 적용하기 위해 실용적이고 실행 가능한 지침을 제공하는 것.
  • 미세조정 없이도 SAM이 기존 최신 기술 수준의 모델보다 우월하거나 유사한 성능을 낼 수 있는지 평가하는 것.
  • SAM이 생성한 마스크가 지상 진술(annotation)의 품질과 효율성을 향상시킬 잠재력을 탐색하는 것.

제안 방법

  • 연구는 6개의 의료 영상 데이터셋에서 경계상자, 다중 점, 조합 형태의 8가지 다른 프롬프팅 전략을 적용한다.
  • SAM은 의료 데이터에 대한 미세조정 없이 원본 ViT 기반 아키텍처와 사전 훈련된 가중치를 사용하여 제로샷 추론을 수행한다.
  • 모든 데이터셋과 프롬프팅 전략에서 딱딱한 지표(Dice, IoU, DSC)를 사용하여 분할 성능을 평가한다.
  • 제안된 프레임워크는 경계상자 프롬프트로 시작하여 가장 우수한 예측을 선택하고, 오류를 수정하기 위해 점 프롬프트(양성 또는 음성)를 사용해 정밀 조정한다.
  • 이 방법은 프롬프트당 다수의 후보 마스크를 생성할 수 있는 SAM의 고용량 비전 트랜스포머 기반 능력을 활용하여 가장 정확한 출력를 선택한다.
  • 재현 가능성과 임상 통합을 위해 시연 및 소스 코드를 공개한다.
Figure 1: Samples from each of the six datasets used in this study. A: ISIC, B: HAM, C: CXR, D: HJXR, E: CVC, F: BUSI.
Figure 1: Samples from each of the six datasets used in this study. A: ISIC, B: HAM, C: CXR, D: HJXR, E: CVC, F: BUSI.

실험 결과

연구 질문

  • RQ1SAM은 어떤 미세조정 없이도 2D 의료 영상에서 경쟁력 있거나 뛰어난 분할 성능를 달성할 수 있는가?
  • RQ2경계상자, 점, 하이브리드 중 어떤 프롬프팅 전략이 다양한 의료 영상 모달리티에서 가장 강력하고 정확한 결과를 낳는가?
  • RQ3의료 영상 분할 작업에 특화해 훈련된 최신 기술 수준의 모델들과 비교해 SAM의 제로샷 성능는 어떻게 되는가?
  • RQ4SAM이 생성한 마스크는 수동 지상 진술(annotation)의 품질과 효율성을 어느 정도 향상시킬 수 있는가?
  • RQ5최소 상호작용 프롬프팅 프레임워크는 다양한 임상 영상 환경에서 일관되게 고품질의 분할을 생성할 수 있는가?

주요 결과

  • SAM은 어떤 미세조정 없이도 BUSI 데이터셋에서 최신 기술 수준의 성능를 달성하며, 이는 기존 방법들을 뛰어넘는 성과이다.
  • 모델은 X-ray, 초음파, 피부내시경, 대장내시경 등 4가지 다른 의료 영상 모달리티에서 강력한 제로샷 일반화 능력을 보였다.
  • 경계상자 프롬프트로 시작하여 점 프롬프트로 정밀 조정하는 제안된 프롬프팅 프레임워크는 최소한의 사용자 상호작용으로도 일관되게 고품질의 분할을 도출했다.
  • 일부 사례에서 SAM의 예측이 지상 진술보다 더 정확했으며, 이는 수동 애노테이션의 품질과 효율성을 향상시킬 잠재력을 시사한다.
  • SAM의 세 가지 ViT 크기(Small, Base, Large) 모두 유사한 성능를 보였으며, 이는 사용자가 계산 자원 제약에 따라 적절한 크기를 선택할 수 있음을 의미한다.
  • 이 프레임워크를 통해 의사들은 가장 우수한 예측을 선택하고 몇 개의 점 프롬프트만으로도 정확한 분할을 달성할 수 있었으며, 임상 적용 가능성은 입증되었다.
Figure 2: Example of all prompt strategies on a skin lesion image and mask. (A): original image, (B): CP, (C): RP, (D): RP3, (E): RP5, (F): BB in green, BBS5 in red, BBS10 in blue, and BBS20 in yellow. The size and position shown are their max variation for BBS methods.
Figure 2: Example of all prompt strategies on a skin lesion image and mask. (A): original image, (B): CP, (C): RP, (D): RP3, (E): RP5, (F): BB in green, BBS5 in red, BBS10 in blue, and BBS20 in yellow. The size and position shown are their max variation for BBS methods.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.