[논문 리뷰] CLIP-DINOiser: Teaching CLIP a few DINO tricks for open-vocabulary semantic segmentation
CLIP-DINOiser는 CLIP의 밀도 높은 특징을 DINO에서 유도된 자기지도화된 국소화 사전 지식을 사용해 개선함으로써 CLIP의 제로샷 개방형 어휘 세분화 성능을 햖थन한다. 이는 CLIP의 단일 순방향 전파 중에 두 개의 경량 컨볼루션 레이어를 적용하여 이루어지며, 어떤 애너테이션도 필요로 하지 않고 재학습 없이 COCO, Pascal Context, Cityscapes, ADE20k에서 최고 성능을 달성한다.
The popular CLIP model displays impressive zero-shot capabilities thanks to its seamless interaction with arbitrary text prompts. However, its lack of spatial awareness makes it unsuitable for dense computer vision tasks, e.g., semantic segmentation, without an additional fine-tuning step that often uses annotations and can potentially suppress its original open-vocabulary properties. Meanwhile, self-supervised representation methods have demonstrated good localization properties without human-made annotations nor explicit supervision. In this work, we take the best of both worlds and propose an open-vocabulary semantic segmentation method, which does not require any annotations. We propose to locally improve dense MaskCLIP features, which are computed with a simple modification of CLIP's last pooling layer, by integrating localization priors extracted from self-supervised features. By doing so, we greatly improve the performance of MaskCLIP and produce smooth outputs. Moreover, we show that the used self-supervised feature properties can directly be learnt from CLIP features. Our method CLIP-DINOiser needs only a single forward pass of CLIP and two light convolutional layers at inference, no extra supervision nor extra memory and reaches state-of-the-art results on challenging and fine-grained benchmarks such as COCO, Pascal Context, Cityscapes and ADE20k. The code to reproduce our results is available at https://github.com/wysoczanska/clip_dinoiser.
연구 동기 및 목표
- 인간이 애너테이션한 세분화 데이터가 전혀 필요 없이 CLIP를 사용해 제로샷 개방형 어휘 세분화를 가능하게 하기 위해.
- 원래부터 노이즈가 많고 세밀한 구조를 갖추지 못한 CLIP의 밀도 높은 특징의 공간 국소화 품질을 향상시키기 위해.
- 피팅 또는 클래스별 프로토타입 구축을 피함으로써 CLIP의 원래 개방형 어휘 능력을 유지하기 위해.
- 단일 CLIP 순방향 전파와 두 개의 경량 컨볼루션 레이어만을 사용해 최소한의 계산 오버헤드로 높은 성능을 달성하기 위해.
- CLIP가 이미 유용한 국소화 사전 지식을 내재하고 있으며, 이는 자기지도화된 가이던스를 통해 추출하고 개선할 수 있음을 보여주기 위해.
제안 방법
- 전역 자기주의 어텐션 레이어를 컨볼루션 레이어로 수정함으로써, 시각-언어 정렬을 유지하면서도 밀도 높은 패치 수준 특징을 생성하는 MaskCLIP를 변형한다.
- DINO의 패치 상관관계 패tern을 모방하는 학습 가능한 컨볼루션 풀링 레이어를 도입하여, CLIP 특징에서 개념 인식 가능하고 국소화된 특징 풀링을 생성한다.
- 애너테이션 없이도 DINO의 자기지도화된 특징을 디스틸레이션 타겟으로 사용하여 풀링 가중치 학습을 유도한다.
- CLIP 특징에서 객체성 점수를 학습하기 위해 두 번째 경량 컨볼루션 레이어를 도입하며, DINO의 비지도 객체성 맵(FORGED)을 모방한다.
- 학습된 풀링 및 객체성 맵을 사용해 CLIP의 단일 순방향 전파 내에서 고품질의 세분화 마스크를 생성한다.
- 이중 경로 메커니즘을 활용: 하나는 개념 인식 가능한 국소화를 위해, 다른 하나는 배경 탐지용이며, 둘 다 DINO를 가이드로 사용해 훈련된다.
실험 결과
연구 질문
- RQ1CLIP의 밀도 높은 특징은 피팅 또는 애너테이션 없이 효과적으로 개선되어 국소화 성능을 향상시킬 수 있는가?
- RQ2자기지도화된 DINO 특징은 CLIP가 더 잘 정렬되고 부드러운 세분화 마스크를 생성하도록 어느 정도 유도할 수 있는가?
- RQ3DINO의 객체성 및 패치 상관관계 사전 지식은 오직 경량 학습 가능한 레이어만을 사용해 CLIP 특징으로 직접 이관될 수 있는가?
- RQ4최소한의 추가 계산만을 갖는 단일 전파 추론 파이프라인은 제로샷 세분화에서 다중 전파 또는 프로토타입 기반 방법보다 우수한 성능을 낼 수 있는가?
- RQ5CLIP-DINOiser는 세밀하고 복잡한 벤치마크에서 최고 성능을 달성하면서도 개방형 어휘 유연성을 유지할 수 있는가?
주요 결과
- CLIP-DINOiser는 COCO, Pascal Context, Cityscapes, ADE20k에서 각각 +6.7 mIoU, +5.1 mIoU, +5.0 mIoU, +2.2 mIoU의 향상으로 최고 성능을 기록하였다.
- Pascal VOC에서 메서드는 60.1 mIoU를 달성하여 MaskCLIP보다 +6.4 mIoU 향상되었으며, FOUND 객체성 맵의 불확실성 기반 개선을 사용할 경우 최대 62.1 mIoU까지 도달했다.
- OVDiff가 각각 개념 프로토타입 구축을 필요로 하므로, Context에서 +2.3 mIoU, Object에서 +0.2 mIoU 향상된 성능을 기록했다.
- Cityscapes와 ADE20k와 같은 복잡한 시나리오에서 CLIP-DIY와 TCL보다 더 정확하고 세밀한 국소화를 제공했다.
- 메서드는 전체 개방형 어휘 능력을 유지하며, CLIP의 단일 순방향 전파 내에서 작동하며, 추론 시에 오직 두 개의 추가 경량 컨볼루션 레이어만을 사용한다.
- 제거 실험 결과, 성능 향상은 개념 인식 가능한 풀링과 학습된 객체성 맵 둘 다에서 기인하며, 특히 배경 세분화 향상에 큰 기여를 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.