[논문 리뷰] EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model
EVF-SAM는 BEIT-3와 같은 다중모달 인코더에서 시각 및 언어 특징을 조기에 융합함으로써 Segment Anything Model(SAM)이 텍스트 프롬프트 기반의 참조 표현 분할을 수행할 수 있도록 하는 단순하면서도 효과적인 방법을 제안한다. 이 방법은 이전의 LLM 기반 방법보다 82% 적은 파라미터를 사용하면서 RefCOCO/+/g 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하여, 조기 시각-언어 융합이 텍스트 전용 또는 후기 융합 방법보다 분할 정확도를 크게 향상시킨다는 것을 입증한다.
Segment Anything Model (SAM) has attracted widespread attention for its superior interactive segmentation capabilities with visual prompts while lacking further exploration of text prompts. In this paper, we empirically investigate what text prompt encoders (e.g., CLIP or LLM) are good for adapting SAM for referring expression segmentation and introduce the Early Vision-language Fusion-based SAM (EVF-SAM). EVF-SAM is a simple yet effective referring segmentation method which exploits multimodal prompts (i.e., image and text) and comprises a pre-trained vision-language model to generate referring prompts and a SAM model for segmentation. Surprisingly, we observe that: (1) multimodal prompts and (2) vision-language models with early fusion (e.g., BEIT-3) are beneficial for prompting SAM for accurate referring segmentation. Our experiments show that the proposed EVF-SAM based on BEIT-3 can obtain state-of-the-art performance on RefCOCO/+/g for referring expression segmentation and demonstrate the superiority of prompting SAM with early vision-language fusion. In addition, the proposed EVF-SAM with 1.32B parameters achieves remarkably higher performance while reducing nearly 82% of parameters compared to previous SAM methods based on large multimodal models.
연구 동기 및 목표
- 현재 점이나 상자와 같은 시각적 프롬프트만 지원하는 Segment Anything Model(SAM)에서 텍스트 프롬프트 기반의 참조 표현 분할이 효과적으로 구현되지 않는 문제를 해결하기 위함.
- CLIP나 대규모 언어 모델(LLM)와 같은 텍스트 프롬프트 인코더 중에서 SAM을 참조 표현 분할(RES)에 적합하게 적응시키는 데 가장 효과적인 것이 무엇인지 탐구하기 위함.
- 다중모달 프롬프트(이미지 + 텍스트)와 조기 시각-언어 융합이 SAM의 RES 작업 성능을 향상시키는지 탐색하기 위함.
- 복잡한 지시 템플릿과 LLM 미세조정의 높은 계산 비용을 피하는 경량적이고 효율적이며 종단 간 프레임워크를 개발하기 위함.
- 조기 융합이 자연어 기반 설명으로 SAM을 프롬프트하는 데 있어 후기 융합 또는 독립적인 텍스트 인코더보다 우수한 성능을 내는지 입증하기 위함.
제안 방법
- EVF-SAM는 조기 시각-언어 융합(예: BEIT-3)을 갖춘 사전 학습된 다중모달 인코더를 통합하여 SAM의 프롬프트 인코더에 적합한 통합 이미지-텍스트 임베딩을 생성한다.
- 이 방법은 다중모달 임베딩을 SAM의 프롬프트 인코더에 적합한 프롬프트 임베딩으로 변환하기 위해 단순한 프로젝터 헤드를 사용한다.
- 표준 교차 엔트로피 손실을 사용하여 RefCOCO, RefCOCO+, RefCOCOg 등의 참조 표현 분할 데이터셋에서 종단 간으로 훈련된다.
- 아키텍처 수정 없이도 사전 구축된 기초 모델(SAM 및 BEIT-3)을 그대로 활용함으로써 확장성과 파라미터 효율성을 확보한다.
- 조기 융합된 인코더의 풍부한 다중모달 표현을 활용하여 짧은 표현뿐 아니라 공간적 및 기술적 언어를 포함한 장문의 참조 표현도 지원한다.
- 경량 버전인 EVF-SAM with Efficient-SAM는 600M 파라미터를 줄였지만 뛰어난 성능을 유지한다.
실험 결과
연구 질문
- RQ1이미지와 텍스트의 다중모달 프롬프트를 사용할 경우, 텍스트 전용 프롬프트보다 SAM의 참조 표현 분할 성능이 향상되는가?
- RQ2SAM을 자연어로 프롬프트할 때, 프롬프트 인코더 내에서 조기 시각-언어 융합이 후기 융합 또는 독립적인 텍스트 인코더보다 더 효과적인가?
- RQ3매우 적은 파라미터를 가진 경량 다중모달 모델(예: BEIT-3)이 LLM보다 SAM의 참조 분할에 더 뛰어난 성능을 내는가?
- RQ4다양한 다중모달 인코더(예: CLIP, ViLT, BEIT-3)의 선택이 텍스트 프롬프트 기반 SAM의 분할 정확도에 어떤 영향을 미치는가?
- RQ5EVF-SAM는 SAM의 다양한 버전(SAM-Huge 대비 Efficient-SAM)과 다양한 벤치마크(RefCOCO/+/g)에 대해 얼마나 일반화 가능한가?
주요 결과
- BEIT-3-Large를 사용한 EVF-SAM는 RefCOCO/+/g 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하여 평균 mIoU가 78.0을 기록하며 이전의 LLM 기반 방법을 뛰어넘었다.
- LISA(이전 SOTA LLM 기반 방법) 대비 82%의 파라미터 감소를 이룩하여 13.2억 파라미터를 유지하면서도 더 뛰어난 성능을 달성했다.
- 더 작은 BEIT-3-Base 인코더는 심각한 성능 저하(예: 평균 mIoU 71.6)를 보였으며, 이는 다중모달 인코더의 모델 용량이 핵심임을 확인한다.
- RefCOCOg에서 CLIP 기반 프롬프트보다 평균 mIoU가 12.7% 높게 기록되어 장문이고 복잡한 참조 표현에 대한 이해 능력이 뛰어나다는 것을 입증한다.
- 수동으로 작성된 지시 템플릿에 의존하지 않으며, 더 적은 훈련 데이터로도 우수한 성능을 달성하여 LLM 기반 접근 방식과 대비된다.
- EVF-SAM의 Efficient-SAM-S 버전은 SAM-Huge 대비 성능 저하가 거의 없이 유지되어, 다양한 SAM 버전 간의 호환성과 효율성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.