[논문 리뷰] CLIP is Also an Efficient Segmenter: A Text-Driven Approach for Weakly Supervised Semantic Segmentation
이 논문은 추가 학습 없이 이미지 레이블만으로 고품질의 가짜 마스크를 생성하는 데 얼랭된 CLIP 모델을 활용하는 텍스트 기반, 약한 감독(semi) 세그멘테이션 프레임워크인 CLIP-ES를 제안한다. 소프트맥스 정규화된 GradCAM, 텍스트 기반 프롬프트 전략, 클래스 인식 주의 기반 유사도 모듈, 신뢰도 유도 손실을 통합함으로써 CLIP-ES는 PASCAL VOC 2012(73.9% mIoU) 및 MS COCO 2014(45.4% mIoU)에서 기존 방법보다 90% 적은 시간으로 최신 기술 수준을 달성한다.
Weakly supervised semantic segmentation (WSSS) with image-level labels is a challenging task. Mainstream approaches follow a multi-stage framework and suffer from high training costs. In this paper, we explore the potential of Contrastive Language-Image Pre-training models (CLIP) to localize different categories with only image-level labels and without further training. To efficiently generate high-quality segmentation masks from CLIP, we propose a novel WSSS framework called CLIP-ES. Our framework improves all three stages of WSSS with special designs for CLIP: 1) We introduce the softmax function into GradCAM and exploit the zero-shot ability of CLIP to suppress the confusion caused by non-target classes and backgrounds. Meanwhile, to take full advantage of CLIP, we re-explore text inputs under the WSSS setting and customize two text-driven strategies: sharpness-based prompt selection and synonym fusion. 2) To simplify the stage of CAM refinement, we propose a real-time class-aware attention-based affinity (CAA) module based on the inherent multi-head self-attention (MHSA) in CLIP-ViTs. 3) When training the final segmentation model with the masks generated by CLIP, we introduced a confidence-guided loss (CGL) focus on confident regions. Our CLIP-ES achieves SOTA performance on Pascal VOC 2012 and MS COCO 2014 while only taking 10% time of previous methods for the pseudo mask generation. Code is available at https://github.com/linyq2117/CLIP-ES.
연구 동기 및 목표
- 정밀한 미세조정 또는 보조 모델 학습이 필요 없이 약한 감독 세그멘테이션(WSSS)을 단순화하는 것.
- 이미지 레이블만으로 CLIP의 제로샷 능력을 활용해 객체 위치 추정을 수행하는 것.
- 새로운 텍스트 기반 및 주의 기반 모듈을 통해 학습 비용을 줄이고 동시에 세그멘테이션 정확도를 유지하거나 향상시키는 것.
- 추가적인 감독 없이도 후속 세그멘테이션에 유용한 신뢰성 있는 가짜 마스크를 생성하는 것.
제안 방법
- 클래스 간 상호 배제성을 강화하고 배경 및 비대상 클래스 혼동을 억제하기 위해 GradCAM에 소프트맥스 정규화를 도입한다.
- 예리도 기반 프롬프트 선택 및 동의어 융합을 제안하여 클래스 특화 활성화 맵 향상을 위한 텍스트 입력 최적화를 수행한다.
- CLIP-ViT의 멀티헤드 자기주의를 활용해 실시간으로 클래스 인식 주의 기반 CAM 보정을 수행하는 클래스 인식 주의 기반 유사도(CAA) 모듈을 설계한다.
- 최종 세그멘테이션 학습 중 신뢰도 유도 손실(CGL)을 적용하여 가짜 마스크의 불확실한 영역을 가중치를 낮춘다.
- 얼랭된 CLIP를 백본으로 사용하여 새로운 클래스나 데이터셋에 대해 미세조정 없이 제로샷 전이가 가능하다.
- 모든 구성 요소를 종합적으로 통합해 별도의 분류 및 유사도 모델 학습 없이 텍스트 기반 엔드 투 엔드 WSSS 파이프라인을 구축한다.
실험 결과
연구 질문
- RQ1미세조정 없이도 CLIP가 이미지 레이블만으로 고품질의 세그멘테이션 마스크를 생성할 수 있는가?
- RQ2CLIP 기반 WSSS에서 클래스 특화 활성화 맵 향상을 위해 텍스트 입력을 어떻게 최적화할 수 있는가?
- RQ3CLIP의 내재된 주의 메커니즘이 외부 유사도 네트워크를 대체해 CAM 보정에 활용될 수 있는가?
- RQ4노이즈가 포함된 가짜 마스크로 학습할 때 신뢰도 유도 손실이 세그멘테이션 성능 향상에 기여하는가?
- RQ5재학습 없이도 새로운 클래스나 데이터셋으로 일반화 가능한가?
주요 결과
- CLIP-ES는 PASCAL VOC 2012 테스트 세트에서 73.9% mIoU를 달성하여 새로운 최신 기술 수준을 수립한다.
- MS COCO 2014에서 CLIP-ES는 검증 세트에서 45.4% mIoU를 기록하며 모든 이전 방법을 능가한다.
- GradCAM에 소프트맥스를 적용함으로써 모든 클래스에서 mIoU가 9.2% 향상되었고, 'boat'와 'water'처럼 유사한 카테고리 간 혼동도 감소했다.
- 동의어 융합은 'person'에 대해 mIoU를 43.6%에서 51.6%로 향상시켜 텍스트 증강의 효과를 입증한다.
- CAA 모듈은 순수한 멀티헤드 자기주의(MHSA)를 초월해 CAM 보정 성능을 향상시켰으며, 시각화 결과는 더 완전하고 정확한 객체 활성화를 보여준다.
- CLIP-ES를 통한 가짜 마스크 생성 시간은 이전 방법 대비 10%에 불과해 학습 효율성이 크게 향상되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.