[논문 리뷰] I-MedSAM: Implicit Medical Image Segmentation with Segment Anything
I-MedSAM는 세그먼트 애니웨어 모델(SAM)과 암묵적 신경 표현(INRs)을 결합하여 일반화 능력과 경계 정확도를 햖스한 새로운 암묵적 의료 영상 분할 프레임워크를 제안한다. 군집에서의 주파수 인식 어댑터와 불확실성 유도 샘플링을 통합한 코arse-to-fine INR 디코더를 통해 I-MedSAM은 단지 1.6M개의 학습 가능한 파rameter로 상태의 기술(SOTA) 성능을 달성하였으며, 2D 의료 영상 분할 벤치마크에서 이산적이고 연속적인 방법을 모두 능가한다.
With the development of Deep Neural Networks (DNNs), many efforts have been made to handle medical image segmentation. Traditional methods such as nnUNet train specific segmentation models on the individual datasets. Plenty of recent methods have been proposed to adapt the foundational Segment Anything Model (SAM) to medical image segmentation. However, they still focus on discrete representations to generate pixel-wise predictions, which are spatially inflexible and scale poorly to higher resolution. In contrast, implicit methods learn continuous representations for segmentation, which is crucial for medical image segmentation. In this paper, we propose I-MedSAM, which leverages the benefits of both continuous representations and SAM, to obtain better cross-domain ability and accurate boundary delineation. Since medical image segmentation needs to predict detailed segmentation boundaries, we designed a novel adapter to enhance the SAM features with high-frequency information during Parameter-Efficient Fine-Tuning (PEFT). To convert the SAM features and coordinates into continuous segmentation output, we utilize Implicit Neural Representation (INR) to learn an implicit segmentation decoder. We also propose an uncertainty-guided sampling strategy for efficient learning of INR. Extensive evaluations on 2D medical image segmentation tasks have shown that our proposed method with only 1.6M trainable parameters outperforms existing methods including discrete and implicit methods. The code will be available at: https://github.com/ucwxb/I-MedSAM.
연구 동기 및 목표
- 이산적 표현의 한계, 즉 공간적 유연성 부족과 경계 분리 능력 열악함을 해결하기 위해.
- 연속적 표현을 활용하여 의료 영상 분할의 교차 도메인 일반화 및 해상도 확장성 향상하기 위해.
- 새로운 어댑터를 통해 주파수 도메인 정보를 SAM 특징에 통합함으로써 SAM의 의료 영상에서의 성능 향상시키기 위해.
- 불확실성 유도 샘플링을 통한 코어스-투-파인(INR) 디코더를 활용하여 암묵적 신경 표현 학습을 최적화하여 효율적이고 정확한 추론 보장하기 위해.
제안 방법
- I-MedSAM은 파aram터 효율적 미세조정(PEFT) 중에 DFT 스펙트럼에서 유도된 고주파 정보를 SAM 특징에 주입하기 위해 주파수 인식 어댑터를 사용한다. 이는 경계 민감도 향상에 기여한다.
- 모델는 이중 단계의 암묵적 신경 표현(INR) 디코더를 활용한다: 코어스 INR이 초기 분할을 예측한 후, 선택된 점들에 대해 정밀화된 INR이 적용된다.
- 불확실성 유도 샘플링은 코어스 INR 출력에서 분산이 가장 높은 상위 K개의 특징 점을 선택하여 모호하거나 복잡한 영역에 집중한 정밀화를 수행한다.
- INR 디코더는 영상 특징과 좌표 격자를 연속적 분할 출력으로 매핑하여 해상도에 영향을 받지 않는 추론을 가능하게 한다.
- 전체 프레임워크는 단지 1.6M개의 학습 가능한 파rameter로 종단 간 훈련되며, SAM의 효율적 미세조정을 위해 LoRA를 활용한다.
- 공간적 및 주파수 도메인 특징을 통합하여 표현 능력을 향상시키면서도 도메인 이동 상황에서도 일반화 능력을 유지한다.

실험 결과
연구 질문
- RQ1암묵적 신경 표현은 의료 영상 분할 모델의 일반화 능력과 해상도 확장성 향상에 기여할 수 있는가?
- RQ2SAM 특징에 주파수 도메인 정보를 통합할 경우 분할 경계 정확도에 어떤 영향을 미치는가?
- RQ3불확실성 유도 샘플링은 의료 영상에서 암묵적 분할의 효율성과 정확도 향상에 기여하는가?
- RQ4선택적 샘플링을 통한 코어스-투-파인 INR 디코더는 표준 INR 또는 이산 예측 헤드보다 의료 영상 분할에서 더 우수한 성능을 내는가?
- RQ5경량적이고 파arameter 효율적인 어댑터는 다양한 의료 영상 도메인에서 SAM의 성능 향상에 어느 정도 기여할 수 있는가?
주요 결과
- I-MedSAM은 BCV 데이터셋에서 86.28%의 Dice 스코어를 기록했으며, AMOS 데이터셋에선 79.86%를 달성하여 최신 이산 및 연속적 방법을 모두 능가했다.
- 제거 실험 결과, LoRA 랭크가 4일 때 최적의 성능을 내며 최소한의 파rameter로 효율성 전략의 타당성을 입증했다.
- 주파수 어댑터를 사용할 경우 진폭 스펙트럼(86.80%)을 활용하면 어댑터 없이 사용할 경우(86.19%)보다 0.61% 향상되었으며, 진폭이 위상보다 더 중요한 역할을 한다.
- 상위 12.5%의 특징 점을 선택하는 불확실성 유도 샘플링은 86.80%의 Dice 스코어를 기록하여 전체 샘플링보다 뛰어난 성능를 보이며 선택적 샘플링이 효과적이고 효율적임을 입증했다.
- I-MedSAM은 Kvasir-Sessile 및 BCV 데이터셋에서의 정성적 비교를 통해 도메인 이동 상황에서도 우수한 일반화 능력을 보였으며, 뛰어난 경계 분리 능력을 확보했다.
- 모델는 단지 1.6M개의 학습 가능한 파rameter로 높은 성능를 유지하였으며, 기준 모델인 nnUNet(126.6M)과 SAMed(3.9M)에 비해 훨씬 적은 파rameter를 사용했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.