Skip to main content
QUICK REVIEW

[논문 리뷰] ZegCLIP: Towards Adapting CLIP for Zero-shot Semantic Segmentation

Ziqin Zhou, Bowen Zhang|arXiv (Cornell University)|2022. 12. 07.
Domain Adaptation and Few-Shot Learning인용 수 9
한 줄 요약

ZegCLIP는 경량 디코더를 사용하여 CLIP의 이미지 수준의 제로샷 분류를 직접 픽셀 수준 예측으로 확장함으로써 일단에 제로샷 세그멘테이션을 수행하는 효율적인 방법을 제안한다. 이는 VOC, COCO, Context 데이터셋에서 최신 기술 수준의 성능을 달성하며, 이중 단계 기반 방법보다 약 5배 빠른 추론 속도를 제공하면서도, 세 가지 핵심 설계를 통해 볼 수 없는 클래스로의 일반화 능력을 유지한다: 딥 프롬프트 튜닝, 상호 배타적이지 않은 손실, 관계 기술자.

ABSTRACT

Recently, CLIP has been applied to pixel-level zero-shot learning tasks via a two-stage scheme. The general idea is to first generate class-agnostic region proposals and then feed the cropped proposal regions to CLIP to utilize its image-level zero-shot classification capability. While effective, such a scheme requires two image encoders, one for proposal generation and one for CLIP, leading to a complicated pipeline and high computational cost. In this work, we pursue a simpler-and-efficient one-stage solution that directly extends CLIP's zero-shot prediction capability from image to pixel level. Our investigation starts with a straightforward extension as our baseline that generates semantic masks by comparing the similarity between text and patch embeddings extracted from CLIP. However, such a paradigm could heavily overfit the seen classes and fail to generalize to unseen classes. To handle this issue, we propose three simple-but-effective designs and figure out that they can significantly retain the inherent zero-shot capacity of CLIP and improve pixel-level generalization ability. Incorporating those modifications leads to an efficient zero-shot semantic segmentation system called ZegCLIP. Through extensive experiments on three public benchmarks, ZegCLIP demonstrates superior performance, outperforming the state-of-the-art methods by a large margin under both "inductive" and "transductive" zero-shot settings. In addition, compared with the two-stage method, our one-stage ZegCLIP achieves a speedup of about 5 times faster during inference. We release the code at https://github.com/ZiqinZhou66/ZegCLIP.git.

연구 동기 및 목표

  • 기존의 CLIP 기반 제로샷 세그멘테이션 방법에서 요구하는 영역 제안 및 CLIP 추론을 위한 별도의 이미지 인코더를 갖는 이중 단계 파이프라인을 단순화하는 것.
  • 시각 인코더를 미세조정하지 않고도 CLIP의 이미지 수준 제로샷 분류 능력을 픽셀 수준 세그멘테이션으로 직접 전이하는 것.
  • 유도적 및 이행적 제로샷 설정 모두에서 본 적 없는 클래스로의 일반화 능력을 향상시키면서도 본 적 있는 클래스에서의 성능도 유지하는 것.
  • 과도하게 본 적 있는 클래스에 과적합되지 않으면서도 CLIP의 본질적 제로샷 능력을 유지하는 경량적이고 효율적이며 종단 간 일단 기반 프레임워크를 개발하는 것.

제안 방법

  • CLIP의 패치 임베딩과 학습 가능한 디코더를 사용하여 텍스트 프롬프트를 픽셀 수준의 국소적 이미지 특징과 직접 매칭하는 일단 기반 프레임워크를 제안한다.
  • 시각 인코더를 업데이트하는 대신 CLIP 텍스트 인코더를 미세조정하는 딥 프롬프트 튜닝(DPT)을 적용하여 CLIP의 제로샷 일반화 능력을 유지한다.
  • 다중 클래스를 독립적으로 예측할 수 있도록 시그모이드 교차 엔트로피를 사용하는 상호 배타적이지 않은 손실(NEL)을 도입하여, 긴 尾 클래스 및 새로운 클래스에서의 성능을 향상시킨다.
  • 매칭 이전에 이미지 수준의 의미적 사전 지식을 텍스트 임베딩에 통합하는 관계 기술자(RD)를 통합하여 본 적 있는 클래스에 대한 과적합을 줄인다.
  • 자기 어텐션을 갖는 경량 디코더를 사용하여 텍스트 임베딩과 CLIP 패치 특징을 비교함으로써 픽셀 단위의 분류를 수행한다.
  • 시각 인코더가 고정되거나 DPT를 통해 튜닝되고, 디코더가 본 적 있는 클래스의 일부 집합에서 종단 간으로 훈련되는 하이브리드 훈련 전략을 채택한다.

실험 결과

연구 질문

  • RQ1두 개의 별도의 이미지 인코더가 필요 없이, CLIP의 이미지 수준 제로샷 분류 능력을 직접 일단 기반 방식으로 픽셀 수준 세그멘테이션으로 확장할 수 있는가?
  • RQ2기본적인 일단 기반 확장 방식이 왜 본 적 없는 클래스로의 일반화에 실패하고 본 적 있는 클래스에 과적합되는가? 그 원인은 무엇인가?
  • RQ3밀도 예측 작업을 위한 미세조정 또는 적응 과정에서 CLIP의 본질적 제로샷 일반화 능력을 어떻게 유지할 수 있는가?
  • RQ4어떤 특정한 아키텍처나 훈련 수정이 본 적 있는 클래스에서의 성능를 유지하면서도 새로운 클래스로의 제로샷 일반화 능력을 크게 향상시킬 수 있는가?
  • RQ5단일 통합 프레임워크가 훈련 시 볼 수 없는 클래스 이름을 사전에 알지 못하더라도, 유도적 및 이행적 제로샷 세그멘테이션 모두를 처리할 수 있는가?

주요 결과

  • 유도적 설정에서 VOC 데이터셋에서 ZegCLIP는 본 적 있는 클래스에서 평균 IoU 91.9%와 본 적 없는 클래스에서 77.8%를 기록하며, 이는 이전 최신 기술 수준 방법을 뛰어넘는 성능이다.
  • COCO 데이터셋에서 ZegCLIP는 본 적 없는 클래스에서 41.4% mIoU를 달성하여 기준선의 39.0%와 이전 최신 기술 수준의 40.2%를 크게 상회한다.
  • 관계 기술자(RD)만으로도 VOC와 COCO에서 본 적 없는 클래스의 mIoU를 약 10个百分点 향상시켜, 과적합 방지를 위한 핵심 역할을 한다는 것을 입증한다.
  • 영역 제안 생성 및 별도의 CLIP 인코딩이 필요 없어지므로, ZegCLIP는 zsseg 및 ZegFormer과 같은 이중 단계 방법보다 약 5배 더 빠른 추론 속도를 달성한다.
  • COCO에서 Context로의 전이 시 ZegCLIP는 41.2% mIoU와 68.4% mAcc를 기록하여 ZegFormer의 36.1% mIoU와 64.0% mAcc를 뛰어넘어 강력한 도메인 간 일반화 능력을 보여준다.
  • 딥 프롬프트 튜닝, NEL, RD의 조합은 본 적 있는 클래스에서 94.6% 픽셀 정확도와 91.9% mIoU, 본 적 없는 클래스에서 77.8% mIoU를 달성하여 전체 설계의 효과성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.