Skip to main content
QUICK REVIEW

[논문 리뷰] Open-vocabulary Semantic Segmentation with Frozen Vision-Language Models

Chaofan Ma, Yuhuan Yang|arXiv (Cornell University)|2022. 10. 27.
Multimodal Machine Learning Applications인용 수 10
한 줄 요약

이 논문은 자기학습 모델에서 동결된 시각적 및 언어적 특징을 정렬함으로써 제로샷 오픈보이드 세그멘테이션을 가능하게 하는 경량의 트랜스포머 기반 융합 모듈인 Fusioner를 제안한다. 동결된 특징만을 사용함에도 불구하고, PASCAL-5i 및 COCO-20i 벤치마크에서 제로샷 및 희소샷 설정에서 이전 방법들을 크게 능가하는 최신 기술 수준의 성능을 달성한다.

ABSTRACT

When trained at a sufficient scale, self-supervised learning has exhibited a notable ability to solve a wide range of visual or language understanding tasks. In this paper, we investigate simple, yet effective approaches for adapting the pre-trained foundation models to the downstream task of interest, namely, open-vocabulary semantic segmentation. To this end, we make the following contributions: (i) we introduce Fusioner, with a lightweight, transformer-based fusion module, that pairs the frozen visual representation with language concept through a handful of image segmentation data. As a consequence, the model gains the capability of zero-shot transfer to segment novel categories; (ii) without loss of generality, we experiment on a broad range of self-supervised models that have been pre-trained with different schemes, e.g. visual-only models (MoCo v3, DINO), language-only models (BERT), visual-language model (CLIP), and show that, the proposed fusion approach is effective to any pair of visual and language models, even those pre-trained on a corpus of uni-modal data; (iii) we conduct thorough ablation studies to analyze the critical components in our proposed Fusioner, while evaluating on standard benchmarks, e.g. PASCAL-5i and COCO-20i , it surpasses existing state-of-the-art models by a large margin, despite only being trained on frozen visual and language features; (iv) to measure the model's robustness on learning visual-language correspondence, we further evaluate on synthetic dataset, named Mosaic-4, where images are constructed by mosaicking the samples from FSS-1000. Fusioner demonstrates superior performance over previous models.

연구 동기 및 목표

  • 사전 훈련된 비전 및 언어 모델을 사용하여 새로운, 미리 보지 않은 객체 카테고리에 대해 제로샷 세그멘테이션을 가능하게 하기.
  • 백본 모델의 미세조정 없이도 동결된 시각적 및 언어적 표현을 효과적으로 융합하는 단순하고 효과적인 융합 메커니즘 개발하기.
  • 단일 모odal (예: MoCo, DINO, BERT) 및 다중 모달 (예: CLIP) 모델을 포함한 다양한 자기학습 전훈 기반 방법에 대해 방법 평가하기.
  • 새로운 합성 벤치마크인 Mosaic-4를 사용하여 시각-언어 기반의 견고성 평가하기.
  • COCO에서 PASCAL VOC로의 도메인 이동에 따른 모델의 이식 가능성 입증하기.

제안 방법

  • 모델은 동결된 시각 인코더(예: MoCo, DINO)와 동결된 언어 인코더(예: BERT, CLIP)를 사용하여 이미지 및 텍스트 특징을 추출한다.
  • 경량의 트랜스포머 기반 융합 모듈이 교차 어텐션을 통해 반복적으로 시각적 및 텍스트 특징을 업데이트함으로써 다중 모odal 상호작용을 가능하게 한다.
  • 각 카테고리에 대해 L2 정규화된 픽셀 특징과 텍스트 임베딩 간의 코사인 유사도를 계산하여 세그멘테이션 마스크를 생성한다.
  • 융합된 특징을 전체 이미지 해상도로 업샘플링하기 위해 시각 디코더를 사용하여 마스크 품질을 향상시킨다.
  • 모든 시각적 및 언어 모델은 훈련 중에 동결되어 있으며, 융합 모듈과 디코더만 훈련 가능하다.
  • 소량의 이미지-세그멘테이션 애너테이션으로 훈련되어 새로운 카테고리에 대한 제로샷 일반화가 가능하다.

실험 결과

연구 질문

  • RQ1간단한 융합 모듈이 제로샷 오픈보이드 세그멘테이션을 위해 동결된 시각적 및 언어적 표현을 효과적으로 융합할 수 있는가?
  • RQ2제안된 방법이 단일 모달(비전 전용 또는 언어 전용) 및 다중 모달(비전-언어) 모델을 포함한 다양한 전훈 기반 방법에 일반화되는가?
  • RQ3도메인 이동 및 복잡한 시나리오 구성 조건 하에서 모델의 시각-언어 기반 성능는 얼마나 견고한가?
  • RQ4백본 모델의 미세조정 없이도 제로샷 및 희소샷 설정에서 최신 기술 수준의 성능를 달성할 수 있는가?
  • RQ5특히 새로운 카테고리에 대해 COCO에서 PASCAL VOC로의 일반화 능력은 얼마나 효과적인가?

주요 결과

  • ViT-L 백본을 사용할 때 Fusioner는 제로샷 설정에서 이전 최신 기술 수준의 방법(LSeg)보다 24.8个百分点 높은 56.5%의 mIoU를 달성하여 COCO-20i에서 뛰어난 성능을 보였다.
  • PASCAL-5i에서 Fusioner는 COCO에서의 제로샷 전이 설정에서 44.4%의 mIoU를 기록하여 이전 최신 기술 수준의 방법(LSeg)을 12.7个百分点 초월했다.
  • 제거 실험 결과, 융합 모듈을 제거하면 성능이 21% 감소함을 확인하여, 이 모듈이 다중 모달 정렬에 핵심적인 역할을 한다는 것을 입증했다.
  • 시각 디코더의 기여가 뚜렷하게 나타났으며, 이를 생략할 경우 성능이 5% 감소함을 확인했다.
  • 합성 벤치마크인 Mosaic-4에서 Fusioner는 시각적 특징을 텍스트 기반 설명에 정확히 기반시키는 데 있어 이전 모델들을 능가하는 뛰어난 견고성을 보였다.
  • MoCo v3, DINO, BERT, CLIP를 포함한 다양한 전훈 기반 방법에 대해 효과적으로 일반화됨을 입증하여, 본 방법의 광범위한 적용 가능성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.