[논문 리뷰] Rewrite Caption Semantics: Bridging Semantic Gaps for Language-Supervised Semantic Segmentation
이 논문은 개념 정제(CoCu)를 제안하며, CLIP 기반의 시각 기반 검색, 텍스트-시각 유도 순위 매기기, 클러스터 기반 샘플링을 통해 이미지 캡션에 누락된 시각적 개념을 확장함으로써 언어 지도형 세분화에서의 의미 간극을 해소하는 삼단계 파이프라인을 제공한다. CoCu는 8개의 세분화 벤치마크에서 제로샷 전이 성능을 크게 향상시켜 평균 mIoU 13.1%를 달성하며 최신 기법들을 압도적으로 능가한다.
Vision-Language Pre-training has demonstrated its remarkable zero-shot recognition ability and potential to learn generalizable visual representations from language supervision. Taking a step ahead, language-supervised semantic segmentation enables spatial localization of textual inputs by learning pixel grouping solely from image-text pairs. Nevertheless, the state-of-the-art suffers from clear semantic gaps between visual and textual modality: plenty of visual concepts appeared in images are missing in their paired captions. Such semantic misalignment circulates in pre-training, leading to inferior zero-shot performance in dense predictions due to insufficient visual concepts captured in textual representations. To close such semantic gap, we propose Concept Curation (CoCu), a pipeline that leverages CLIP to compensate for the missing semantics. For each image-text pair, we establish a concept archive that maintains potential visually-matched concepts with our proposed vision-driven expansion and text-to-vision-guided ranking. Relevant concepts can thus be identified via cluster-guided sampling and fed into pre-training, thereby bridging the gap between visual and textual semantics. Extensive experiments over a broad suite of 8 segmentation benchmarks show that CoCu achieves superb zero-shot transfer performance and greatly boosts language-supervised segmentation baseline by a large margin, suggesting the value of bridging semantic gap in pre-training data.
연구 동기 및 목표
- 웹에서 크롤링한 이미지-텍스트 쌍에서 핵심 시각적 개념이 캡션에 누락되어 발생하는 일반적인 의미 간극을 해결함으로써, 세분화를 위한 효과적인 사전 훈련을 방해하는 문제를 해결한다.
- 사전 훈련 데이터에서 누락된 시각적 개념을 텍스트 표현에 통합함으로써 언어 지도형 세분화에서 제로샷 일반화 성능을 향상시킨다.
- 수집된 개념에 대한 의미 편향을 방지하면서도 포괄적이고 다양한 시각적 개념 커버리지 보장을 보장하는 견고한 파이프라인을 개발한다.
- 개념 정제가 제로샷 세분화 및 제로샷 분류 성능 향상에 어떻게 기여하는지 입증한다.
제안 방법
- 시각 기반 확장은 CLIP 임베딩을 사용해 다른 이미지에서 관련 개념을 검색함으로써 개념 아카이브를 구축하며, 시각적 개념의 편향 없는 커버리지 보장을 확보한다.
- 텍스트-시각 유도 순위 매기기는 CLIP의 시각-언어 정렬을 활용해 검색된 개념들이 입력 이미지와 의미적으로 얼마나 관련성이 있는지 점수를 매긴다.
- 클러스터 기반 샘플링은 의미 클러스터링을 활용해 중복을 방지하고 표현의 다양성을 향상시키며, 다양하고 높은 관련성의 개념을 선택한다.
- 정제된 개념들은 사전 훈련 데이터에 통합되어 모델이 텍스트 쿼리와 정확한 픽셀 수준 영역을 연관짓는 능력을 향상시킨다.
- 파이프라인은 이미지-텍스트 쌍을 기반으로 GroupViT를 사전 훈련에서부터 재학습하고, 여러 세분화 벤치마크에서 제로샷 평가를 수행한다.
- 재학습된 시각-언어 인코더를 피하기 위해 표준형 CLIP 모델을 활용함으로써 효율적이고 확장 가능한 개념 정제를 가능하게 한다.

실험 결과
연구 질문
- RQ1다른 이미지에서 누락된 시각적 개념을 캡션에 보완함으로써 제로샷 세분화 성능을 향상시킬 수 있는가?
- RQ2의미 편향을 최소화하면서도 입력 이미지와의 관련성을 극대화하기 위해 어떻게 효과적으로 시각적 개념을 검색하고 순위를 매길 수 있는가?
- RQ3개념 샘플링 단계에서 클러스터링을 통해 의미 다양성을 통합하면 제로샷 세분화에서 더 나은 일반화 성능을 달성할 수 있는가?
- RQ4개념 정제가 세분화를 초월해 이미지 분류와 같은 다른 작업에도 어느 정도 제로샷 전이 성능 향상에 기여하는가?
주요 결과
- CoCu는 8개의 세분화 벤치마크에서 평균 mIoU 13.1%를 달성하며 기준 모델인 GroupViT 대비 4.9% 향상되었다.
- 제거 실험 결과, CoCu의 각 구성 요소—시각 기반 확장, 텍스트-시각 순위 매기기, 클러스터 기반 샘플링—이 성능 향상에 점진적으로 기여하는 것으로 확인되었다.
- C3, C12, Y14 데이터에서 사전 훈련한 CoCu는 ImageNet-1K 분류 정확도를 top-1 기준 6.2%, top-5 기준 6.9% 향상시켰으며, GroupViT를 능가했다.
- 시각 기반 확장 단계만으로도 기준 모델 대비 mIoU가 2.1% 향상되었으며, 이는 의미 편향 감소에 기여하는 바가 크다는 것을 시사한다.
- 클러스터 기반 샘플링은 다른 샘플링 전략 대비 가장 큰 마진 성과 기여를 하여 의미 다양성이 견고한 사전 훈련에 핵심적임을 입증한다.
- 모든 8개의 평가된 세분화 벤치마크에서 일관되게 성능 향상을 보였으며, 이는 광범위한 적용 가능성과 일반화 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.