Skip to main content
QUICK REVIEW

[논문 리뷰] Learnable Ophthalmology SAM

Zhongxi Qiu, Yan Hu|arXiv (Cornell University)|2023. 04. 26.
Retinal Imaging and Analysis인용 수 12
한 줄 요약

이 논문은 Segment Anything (SAM)에 학습 가능한 프롬프트 레이어를 도입하여 백본을 고정하고 작업별 프롬프트와 헤드를 학습시키는 방식으로 원샷 다중 모달 안과 영상 분할을 가능하게 한다. 이는 여러 안과 작업 및 데이터셋에서 강한 일반화와 함께 분할 성능의 개선을 보여준다.

ABSTRACT

Segmentation is vital for ophthalmology image analysis. But its various modal images hinder most of the existing segmentation algorithms applications, as they rely on training based on a large number of labels or hold weak generalization ability. Based on Segment Anything (SAM), we propose a simple but effective learnable prompt layer suitable for multiple target segmentation in ophthalmology multi-modal images, named Learnable Ophthalmology Segment Anything (SAM). The learnable prompt layer learns medical prior knowledge from each transformer layer. During training, we only train the prompt layer and task head based on a one-shot mechanism. We demonstrate the effectiveness of our thought based on four medical segmentation tasks based on nine publicly available datasets. Moreover, we only provide a new improvement thought for applying the existing fundamental CV models in the medical field. Our codes are available at \href{https://github.com/Qsingle/LearnablePromptSAM}{website}.

연구 동기 및 목표

  • 다중 모달 영상화와 제한된 레이블로 인한 안과 분야의 분할 필요성에 동기를 부여한다.
  • SAM의 트랜스포머 블록 사이에 학습 가능한 프롬프트 레이어를 삽입하여 의료 선행 지식을 주입한다.
  • 프롬프트 레이어와 작업 헤드만 학습시키는 원샷 미세조정을 가능하게 한다.
  • 다양한 작업(혈관, 병변, 망막 층)과 데이터셋에 걸친 효과를 보여준다.
  • 제로샷 실험을 통해 데이터셋 간 일반화를 평가한다.

제안 방법

  • SAM 백본을 고정하면서 각 트랜스포머 블록 사이에 학습 가능한 프롬프트 레이어를 삽입한다.
  • LayerNorm과 GELU를 갖춘 두 개의 1x1 합성곱과 깊이별 3x3 합성곱을 사용하여 각 Prompt_i를 형성한다.
  • i번째 트랜스포머 입력 피처에서 프롬프트를 계산: Prompt_i = delta(LN(W1(delta(LN(DW3(delta(LN(W1(fi)))))))).
  • 업샘플링과 다중 스케일 합성곱을 가진 작업별 분할 헤드를 부착하여 분할 맵을 생성한다.
  • 원샷 메커니즘으로 프롬프트 레이어와 작업 헤드만 학습한다.
  • Dice, Precision, Recall, BM, IoU 등의 지표를 사용하여 세 가지 분할 작업(혈관, 병변, 망막 층)에서 아홉 개 공공 데이터셋을 평가한다.

실험 결과

연구 질문

  • RQ1학습 가능한 프롬프트 레이어가 전체 미세조정 없이 SAM이 다중 모달 이미지에서 안과 특정 대상을 분할하게 할 수 있는가?
  • RQ2제안된 프롬프트가 데이터셋과 모달리티 전반에 일반화되는 의료 priors를 학습하는가?
  • RQ3의료 분할에서 프롬프트와 헤드의 원샷 학습이 전체 미세조정이나 헤드만 튜닝과 비교하여 어떤 차이가 있는가?
  • RQ4혈관, 병변, 망막 층 분할 작업에서 방법의 성능 및 일반화는 어떠한가?

주요 결과

  • 학습 가능한 안과용 프롬프트는 원샷 미세조정으로 여러 작업에서 경쟁력 있거나 향상된 분할 성능을 보인다.
  • 제로샷 테스트에서 한 데이터셋에서 학습된 프롬프트는 다른 두 모달 혈관 분할 데이터셋과 서로 다른 제조사의 OCTA 데이터셋에 잘 일반화한다.
  • OCT 망막 층 분할(ARoI)에서 Dice는 기본 SAM 대비 약 25% 향상한다.
  • 이 방법은 OCTA에서 큰 혈관 분할 및 망막 층 분할을 SAM 단독보다 여러 경우에 더 효과적으로 수행한다.
  • 작거나 아주 작은 대상은 SAM 기반 프롬프트에 여전히 도전적이며 작은 객체에 대한 추가 프롬프트 개선이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.