[논문 리뷰] CAT-Seg: Cost Aggregation for Open-Vocabulary Semantic Segmentation
CAT-Seg는 CLIP 이미지-텍스트 유사도 맵(비용 볼륨)을 최적화함으로써 직접 CLIP 임베딩을 미세조정하는 대신 개방형 어휘(capability)를 유지하는 새로운 비용 집계 프레임워크를 제안한다. 임베딩 가이던스를 활용해 비용 볼륨 내에서 공간적 및 클래스별 관계를 동시에 집계하는 트랜스포머 기반 모듈을 사용함으로써, ADE20K, PASCAL VOC, PASCAL-Context에서 최신 기준 성능을 달성하며, ADE20K-847에서 이전 방법 대비 22%의 mIoU 향상을 기록한다.
Open-vocabulary semantic segmentation presents the challenge of labeling each pixel within an image based on a wide range of text descriptions. In this work, we introduce a novel cost-based approach to adapt vision-language foundation models, notably CLIP, for the intricate task of semantic segmentation. Through aggregating the cosine similarity score, i.e., the cost volume between image and text embeddings, our method potently adapts CLIP for segmenting seen and unseen classes by fine-tuning its encoders, addressing the challenges faced by existing methods in handling unseen classes. Building upon this, we explore methods to effectively aggregate the cost volume considering its multi-modal nature of being established between image and text embeddings. Furthermore, we examine various methods for efficiently fine-tuning CLIP.
연구 동기 및 목표
- CLIP의 이미지 수준의 시각-언어 지식을 픽셀 수준의 세그멘테이션으로 전이하면서도 그 개방형 어휘 능력을 떨어뜨리지 않는 문제를 해결한다.
- 편향된 영역 제안에 의존하고 전역적 맥락 이해 능력이 부족한 이단계 방법의 한계를 극복한다.
- 추론 시에 사전에 노출되지 않은 임의의 새로운 카테고리에 대해 효과적이고 일반화 가능한 세그멘테이션을 가능하게 하는 방법을 개발한다.
- 이미지 임베딩을 직접 미세조정하는 대신 비용 볼륨을 최적화하여 CLIP의 사전 학습된 개방형 어휘 일반화 능력을 유지한다.
- 기존의 이단계 접근 방식에서 발생하는 편향을 극복하고, 세밀한 새로운 카테고리에 대해 강력한 부분 수준의 세그멘테이션을 가능하게 한다.
제안 방법
- CLIP의 이미지 및 텍스트 임베딩 간의 코사인 유사도 맵으로 조밀한 비용 볼륨을 구성한다.
- 공간적 및 클래스별 구성 요소로 분해된 비용 집계를 수행하는 트랜스포머 기반의 비용 집계 모듈을 설계한다.
- 비용 집계 과정에서 시각적 및 텍스트 특징 간의 정렬을 향상시키기 위해 임베딩 가이던스를 도입한다.
- 집계된 비용 볼륨에서 세그멘테이션 마스크를 재구성하기 위해 경량 디코더를 사용하며, 세부 정보를 유지한다.
- 트랜스포머의 어텐션 레이어만 미세조정하여 CLIP의 전체 미세조정을 방지함으로써 사전 학습된 지식을 유지한다.
- 비용 볼륨을 주요 최적화 대상으로 삼아 엔드 투 엔드로 훈련함으로써 CLIP의 개방형 어휘 성능 저하를 최소화한다.
![Figure 1: Teaser. For open-vocabulary semantic segmentation, we propose to aggregate a matching cost derived from dense image and text embeddings of CLIP [ 44 ] , resulting in state-of-the-art performance across all benchmarks.](https://ar5iv.labs.arxiv.org/html/2303.11797/assets/x1.png)
실험 결과
연구 질문
- RQ1이미지 임베딩을 직접 미세조정하는 대신 CLIP 이미지-텍스트 유사도 맵(비용 볼륨)을 최적화하면, 픽셀 수준의 세그멘테이션에서 CLIP의 개방형 어휘 일반화 능력이 유지되는가?
- RQ2공간적 및 클래스별 어텐션을 갖춘 비용 집계는 본인 카테고리와 새로운 카테고리 양쪽에서 세그멘테이션 성능을 어떻게 향상시키는가?
- RQ3영역 제안을 사용하고 각 영역을 별도로 분류하는 이단계 접근 방식보다, 제안된 방법이 더 잘 일반화되는가?
- RQ4학습 중에 노출되지 않은 세밀한 새로운 카테고리, 예를 들어 'arm'이나 'birdcage'와 같은 카테고리를 프레임워크가 처리할 수 있는가?
- RQ5백본 용량이 증가함에 따라 모델은 어떻게 스케일링되며, 효율성과 성능 향상은 유지되는가?
주요 결과
- CAT-Seg는 ADE20K, PASCAL VOC, PASCAL-Context 등 모든 벤치마크에서 최신 기준 성능을 달성하며, ADE20K-847에서 이전 방법 대비 22%의 mIoU 향상을 기록한다.
- ADE20K-847에서 ViT-G 백본을 사용할 경우 mIoU가 44.9에 도달하여 대규모 개방형 어휘 세그멘테이션에서 뛰어난 성능을 보인다.
- ADE20K-150에서 ViT-B에서 ViT-G로 확장할 경우 mIoU가 9.0% 향상되어 유리한 스케일링 행동을 보인다.
- 비용 볼륨 기반 계산이 클래스 수에 따라 스케일링되므로, 모델 크기가 증가할수록 이단계 기준보다 추론 속도가 더 빠르다.
- 모델은 부분 세그멘테이션에 대해 잘 일반화된다: 'arm'이나 'leg'과 같은 사전에 노출되지 않은 세밀한 카테고리를 성공적으로 세그멘테이션하며, 이단계 방법은 제안 편향으로 인해 실패한다.
- 제거 실험을 통해 비용 볼륨 최적화가 직접 CLIP 임베딩을 미세조정하는 것과 달리 개방형 어휘 능력 저하를 방지함을 확인했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.