[논문 리뷰] ZegOT: Zero-shot Segmentation Through Optimal Transport of Text Prompts
ZegOT는 고정된 CLIP 이미지 임베딩과 유연한 텍스트 프롬프트를 최적화된 운반 이론을 통해 정렬함으로써 각 프롬프트가 서로 다른 시각적 특징에 집중할 수 있도록 하는 새로운 제로샷 세분화 프레임워크를 제안한다. 다중 프롬프트 최적 운반(MPOT) 솔버를 도입함으로써 ZegOT는 비호모지어지스의 시각-언어 모델을 미세조정하지 않고도 PASCAL VOC 2012 및 PASCAL Context에서 최신 기술 수준의 성능을 달성한다.
Recent success of large-scale Contrastive Language-Image Pre-training (CLIP) has led to great promise in zero-shot semantic segmentation by transferring image-text aligned knowledge to pixel-level classification. However, existing methods usually require an additional image encoder or retraining/tuning the CLIP module. Here, we propose a novel Zero-shot segmentation with Optimal Transport (ZegOT) method that matches multiple text prompts with frozen image embeddings through optimal transport. In particular, we introduce a novel Multiple Prompt Optimal Transport Solver (MPOT), which is designed to learn an optimal mapping between multiple text prompts and visual feature maps of the frozen image encoder hidden layers. This unique mapping method facilitates each of the multiple text prompts to effectively focus on distinct visual semantic attributes. Through extensive experiments on benchmark datasets, we show that our method achieves the state-of-the-art (SOTA) performance over existing Zero-shot Semantic Segmentation (ZS3) approaches.
연구 동기 및 목표
- 시각-언어 모델을 미세조정하지 않고 제로샷 세분화 문제를 해결하기 위해.
- 픽셀 수준의 예측에서 다중 텍스트 프롬프트와 시각적 특징 간의 정렬을 향상시키기 위해.
- 각 텍스트 프롬프트가 이미지의 서로 다른 의미적 특징에 집중하도록 하여 프롬프트 붕괴를 방지하기 위해.
- CLIP를 고정하고, 학습 가능한 텍스트 프롬프트와 디코더만을 사용하여 최신 기술 수준의 성능를 달성하기 위해.
제안 방법
- 다중 텍스트 프롬프트와 고정된 이미지 인코더 특징 간의 최적 매핑을 학습하기 위해 다중 프롬프트 최적 운반(MPOT) 솔버를 도입한다.
- 다양한 할당을 가능하게 하기 위해 Sinkhorn 알고리즘을 사용하여 기울기 가능하고 다대일의 할당을 수행하며, 각 픽셀이 모든 프롬프트와 부분적으로 연결되도록 한다.
- 학습된 클래스에 대해 운반 계획을 최적화하고, 이를 통해 본래의 클래스뿐 아니라 미리보지 않은 클래스의 점수 맵 예측에 적용한다.
- 전역적 텍스트 임베딩 정렬을 위해 선형층을 사용하고, 픽셀 수준의 세분화를 위해 학습 가능한 이미지 디코더를 활용한다.
- 시각-언어 정렬 특성을 유지하면서도 이미지 및 텍스트 인코더를 재학습하거나 미세조정하지 않는다.
- 최적 운반을 통해 프롬프트 간의 의미적 집중을 분리함으로써 유사한 특징로 수렴하는 것을 방지한다.

실험 결과
연구 질문
- RQ1최적 운반 이론이 제로샷 세분화에서 다중 텍스트 프롬프트와 시각적 특징 간의 정렬에 효과적으로 작용할 수 있는가?
- RQ2최적 운반을 통한 다대일 할당이 일대일 또는 어텐션 기반 매칭보다 프롬프트 분포와 세분화 정확도에서 뛰어난 성능을 내는가?
- RQ3완전히 고정된 CLIP 모델이 학습 가능한 텍스트 프롬프트와 디코더만을 사용하여도 조밀한 예측에 효과적으로 활용될 수 있는가?
- RQ4MPOT는 기준 프롬프트 정렬 대비 본래의 클래스와 새로운 클래스 모두에서 성능 향상에 기여하는가?
주요 결과
- ZegOT는 PASCAL VOC 2012에서 90.9 mIoU (U)와 91.4 hIoU를 기록하여 기존 방법을 모두 능가하는 최신 기술 수준의 성능를 달성한다.
- PASCAL Context에서는 72.5 mIoU (U)와 59.5 hIoU를 기록하여, 새로운 클래스로의 일반화 능력이 뛰어나다는 것을 입증한다.
- MPOT를 제거한 추론 실험에서 PASCAL VOC 2012에서 mIoU (U)가 5.5% 감소하고, PASCAL Context에서는 7.5% 감소하여 MPOT의 핵심적 역할을 확인한다.
- Sinkhorn 기반 최적 운반은 PASCAL VOC 2012에서 이분할 매칭 대비 5.7 hIoU 향상되었고, PASCAL Context에서는 7.9 hIoU 향상되었다.
- 자기 어텐션 기반 매칭은 PASCAL VOC 2012에서 ZegOT 대비 6.5% mIoU (U) 낮고, PASCAL Context에서는 13.2% 낮아, OT가 고정된 모델 지식을 효과적으로 유지하는 데 유리함을 입증한다.
- t-SNE 시각화 결과는 MPOT가 분산되고 클래스별 특성에 맞는 프롬프트 분포를 만들어내는 반면, 기준 방법은 뭉툭하고 구분되지 않는 프롬프트 집합을 보여준다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.