Skip to main content
QUICK REVIEW

[논문 리뷰] CLIP Is Also a Good Teacher: A New Learning Framework for Inductive Zero-shot Semantic Segmentation

Jialei Chen, Daisuke Deguchi|arXiv (Cornell University)|2023. 10. 03.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 기존 CLIP 아키텍처를 수정하지 않고 CLIP을 지식 정복의 교사로 활용하는 새로운 프레임워크인 CLIPTeacher를 제안한다. 이는 유도적 제로샷 세분화를 위한 것으로, CLIP의 CLS 토큰을 조밀한 특징과 정렬하기 위한 글로벌 러닝 모듈(GML)과, CLIP의 조밀한 토큰에 다중 척도 K-평균을 적용하여 비표기(무시된) 영역에서 의사(annotation)를 생성하는 픽셀 러닝 모듈(PLM)을 도입함으로써 이미지의 전체 내용을 효율적으로 활용한다. 이 방법은 최신 기술 수준의 성능을 달성하여, PASCAL Context에서 mIoU를 8.8% 향상시키고, VOC 2012에서 2.2%, COCO-Stuff 164k에서 1.3% 향상시켰다.

ABSTRACT

Generalized Zero-shot Semantic Segmentation aims to segment both seen and unseen categories only under the supervision of the seen ones. To tackle this, existing methods adopt the large-scale Vision Language Models (VLMs) which obtain outstanding zero-shot performance. However, as the VLMs are designed for classification tasks, directly adapting the VLMs may lead to sub-optimal performance. Consequently, we propose CLIP-ZSS (Zero-shot Semantic Segmentation), a simple but effective training framework that enables any image encoder designed for closed-set segmentation applied in zero-shot and open-vocabulary tasks in testing without combining with VLMs or inserting new modules. CLIP-ZSS consists of two key modules: Global Learning Module (GLM) and Pixel Learning Module (PLM). GLM is proposed to probe the knowledge from the CLIP visual encoder by pulling the CLS token and the dense features from the image encoder of the same image and pushing others apart. Moreover, to enhance the ability to discriminate unseen categories, PLM consisting of pseudo labels and weight generation is designed. To generate semantically discriminated pseudo labels, a multi-scale K-Means with mask fusion working on the dense tokens is proposed. In pseudo weight generation, a synthesizer generating pseudo semantic features for the unannotated area is introduced. Experiments on three benchmarks show large performance gains compared with SOTA methods.

연구 동기 및 목표

  • 고정된 백본 또는 명시적 마스크 제안기 요구로 인해 제한되는 기존 CLIP 기반 제로샷 세분화 방법의 한계를 해결하기 위해.
  • 일반적으로 폐기되는 표기된(보이는) 영역과 비표기된(무시된) 영역을 모두 효율적으로 활용하여 성능을 향상시키기 위해.
  • CLIP의 아키텍처를 변경하거나 마스크 헤드와 같은 추가 컴포넌트를 추가하지 않고도, 어떤 세분화 모델이 제로샷 세분화를 수행할 수 있도록 하기 위해.
  • CLIP의 시각-언어 정렬을 활용하여 제로샷 일반화 능력을 향상시키는 유연하고 즉시 사용 가능한 프레임워크 개발하기 위해.

제안 방법

  • 세분화 모델의 조밀한 특징과 CLIP의 CLS 토큰을 정렬하기 위해 자기주의(self-attention)를 사용하는 글로벌 러닝 모듈(GML)을 도입하여 전역 지식 정복을 가능하게 한다.
  • 비표기 영역에서 의미적으로 일관된 영역을 발견하기 위해 CLIP의 조밀한 시각 토큰에 다중 척도 K-평균 군집화를 적용하는 픽셀 러닝 모듈(PLM)을 제안한다.
  • 무시된 영역에서 검출된 잠재적 객체를 진정한 표기된 카테고리와 융합하여 의사 레이블을 생성하기 위해 마스크 융합 알고리즘을 사용한다.
  • 새로 발견된 의사 객체의 분류기 가중치를 생성하기 위해 트랜스포머 디코더를 갖춘 시각-언어 어댑터(VLA)를 활용한다.
  • 원본 CLIP 모델을 그대로 유지하고, 경량 두 개의 모듈만 통합함으로써, 어떤 픽셀 수준의 세분화 백본과도 호환 가능하다.
  • 명시적 마스크 제안 네트워크를 피하고, CLIP의 시각 인코더를 미세조정하지도 않는다.

실험 결과

연구 질문

  • RQ1CLIP의 아키텍처를 수정하지 않고도 제로샷 세분화를 위한 지식 정복 교사로 효과적으로 활용할 수 있는가?
  • RQ2이미지의 비표기(무시된) 영역을 어떻게 활용하여 제로샷 일반화 능력을 향상시킬 수 있는가?
  • RQ3조밀한 CLIP 토큰을 사용하여 비표기 영역에서 새로운 카테고리에 대한 의사 레이블을 발견하고 생성할 수 있는가?
  • RQ4CLS 토큰과 조밀한 특징 사이의 자기주의 기반 정렬이 새로운 카테고리의 제로샷 인식을 향상시키는가?
  • RQ5트랜스포머 기반의 시각-언어 어댑터가 무시된 영역에서 발견된 의사 객체에 대해 신뢰할 수 있는 분류기 가중치를 생성할 수 있는가?

주요 결과

  • CLIPTeacher는 최신 기술 수준의 방법보다 PASCAL VOC 2012에서 mIoU를 2.2% 향상시켰다.
  • COCO-Stuff 164k에서 mIoU를 1.3% 향상시켜 대규모 데이터셋에서도 강력한 일반화 능력을 보였다.
  • PASCAL Context에서 CLIPTeacher는 8.8%의 mIoU 향상을 기록하여, 많은 카테고리가 포함된 복잡한 시나리오에서의 효과성을 입증했다.
  • 제거 실험에서는 GLM를 제거할 경우 mIoU가 45.4%에서 13.2%로 32.2% 감소하여, 새로운 카테고리 인식에 있어 GLM의 핵심적 역할을 입증했다.
  • 자기주의 기반 GLM는 최댓값 풀링과 평균 풀링보다 각각 9.9%와 3.4% 높은 성능을 보여, 전체 특징 활용의 중요성을 확인했다.
  • 다중 척도 K-평균과 마스크 융합을 포함한 PLM는 MLP 및 원본 특징 기반 베이스라인보다 mIoU에서 각각 0.2%와 0.3% 높은 성능을 기록하여 설계 선택의 타당성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.