Skip to main content
QUICK REVIEW

[논문 리뷰] A Simple Baseline for Open-Vocabulary Semantic Segmentation with Pre-trained Vision-language Model

Mengde Xu, Zheng Zhang|arXiv (Cornell University)|2021. 12. 29.
Multimodal Machine Learning Applications인용 수 12
한 줄 요약

이 논문은 사전 훈련된 시각-언어 모델(CLIP)를 사용하여 오픈-보기어드로우드 세그멘테이션을 위한 단순한 이단계 프레임워크를 제안한다. 먼저 클래스에 관계없이 마스크 제안을 생성하고, 그 다음에 자르힌 이미지 패치에 CLIP를 적용하여 각 제안을 분류한다. 이로써 SOTA 수준의 제로샷 성능을 달성한다: Pascal VOC 2012에서 +29.5 hIoU, COCO Stuff에서 +8.9 hIoU를 기록하며, 이는 이전 방법들보다 크게 뛰어나다.

ABSTRACT

Recently, open-vocabulary image classification by vision language pre-training has demonstrated incredible achievements, that the model can classify arbitrary categories without seeing additional annotated images of that category. However, it is still unclear how to make the open-vocabulary recognition work well on broader vision problems. This paper targets open-vocabulary semantic segmentation by building it on an off-the-shelf pre-trained vision-language model, i.e., CLIP. However, semantic segmentation and the CLIP model perform on different visual granularity, that semantic segmentation processes on pixels while CLIP performs on images. To remedy the discrepancy in processing granularity, we refuse the use of the prevalent one-stage FCN based framework, and advocate a two-stage semantic segmentation framework, with the first stage extracting generalizable mask proposals and the second stage leveraging an image based CLIP model to perform open-vocabulary classification on the masked image crops which are generated in the first stage. Our experimental results show that this two-stage framework can achieve superior performance than FCN when trained only on COCO Stuff dataset and evaluated on other datasets without fine-tuning. Moreover, this simple framework also surpasses previous state-of-the-arts of zero-shot semantic segmentation by a large margin: +29.5 hIoU on the Pascal VOC 2012 dataset, and +8.9 hIoU on the COCO Stuff dataset. With its simplicity and strong performance, we hope this framework to serve as a baseline to facilitate future research. The code are made publicly available at~\url{https://github.com/MendelXu/zsseg.baseline}.

연구 동기 및 목표

  • 이미지 수준의 시각-언어 모델(예: CLIP)을 픽셀 수준의 세그멘테이션 작업에 적용하는 데 발생하는 격차를 해소하기 위해.
  • CLIP의 이미지 수준과 픽셀 수준의 세그멘테이션 간의 해상도 불일치 문제를 해결하기 위해 마스크 생성과 분류를 분리함으로써.
  • 사전 훈련된 CLIP와 단순한 이단계 파이프라인만을 사용하여도 새로운 카테고리에 대해 강력한 제로샷 일반화를 가능하게 하기 위해.
  • 미래의 오픈-보기어드로우드 세그멘테이션 연구를 위한 단순하면서도 효과적인 기준을 설정하기 위해.

제안 방법

  • 이 방법은 이단계 프레임워크를 사용한다: 먼저 마스크 헤드(예: MaskFormer)를 사용해 클래스에 관계없는 마스크 제안을 생성하고, 그 다음에 자르힌 이미지 패치에 CLIP를 적용해 각 제안을 분류한다.
  • 각 마스크 제안을 사용해 입력 이미지를 자르고, 자른 패치를 사전 훈련된 CLIP 모델에 입력하여 제로샷 분류를 수행한다.
  • 새로운 카테고리에서의 정확도 향상을 위해 학습 가능한 프롬프트 튜닝 전략을 적용하며, 프롬프트는 볼 수 있는 카테고리들만으로 학습된다.
  • CLIP와 픽셀 수준의 분류 간의 해상도 불일치로 인해 성능이 떨어지는 단일 단계 FCN 접근 방식을 피하기 위해.
  • 자른 패치의 배경 픽셀은 학습 가능한 값이나 마스크 토큰으로 채우며, 이러한 방법들은 불안정성을 보이며 단순한 베이스라인 전략에 뒤지게 된다.
  • 마스크된 영역 추론을 통해 이미지 수준의 인식과 픽셀 수준의 세그멘테이션 간의 일치를 이루기 위해 CLIP의 강력한 시각-카테고리 일치 기능을 활용한다.

실험 결과

연구 질문

  • RQ1시각적 해상도의 불일치에도 불구하고, 사전 훈련된 시각-언어 모델인 CLIP이 오픈-보기어드로우드 세그멘테이션에 효과적으로 적용될 수 있는가?
  • RQ2마스크 제안 생성과 분류를 분리한 이단계 프레임워크가 제로샷 세그멘테이션에서 단일 단계 FCN 기반 접근 방식보다 우월한가?
  • RQ3CLIP에서의 프롬프트 학습이 세그멘테이션 작업에서 새로운 카테고리로의 제로샷 일반화에 어떻게 기여하는가?
  • RQ4마스크된 이미지 패치에서 배경 채우기 전략의 차이가 세그멘테이션 성능에 어떤 영향을 미치는가?
  • RQ5이 방법은 파인튜닝 없이도 다양한 데이터셋 간에서 잘 일반화되는가, 특히 데이터셋 간 평가 환경에서?

주요 결과

  • 크로스-데이터셋 평가에서, 이단계 프레임워크는 Cityscapes에서 +13.1 mIoU, Pascal Context에서 +19.6 mIoU, ADE20k(150개 클래스)에서 +5.6 mIoU, ADE20k(847개 클래스)에서 +2.9 mIoU의 성능 향상을 기록하며 FCN 기반 베이스라인을 뛰어넘었다.
  • Pascal VOC 2012에서, 이 방법은 자가 훈련을 사용함에도 불구하고 이전 SOTA 방법보다 +29.5 hIoU의 성능 향상을 기록했다.
  • COCO Stuff에서, 이 방법은 이전 SOTA에 비해 +8.9 hIoU의 성능 향상을 기록하며, 새로운 카테고리로의 강력한 일반화 능력을 입증했다.
  • 학습 가능한 프롬프트 튜닝은 수동으로 설계된 프롬프트보다 +9.9 hIoU의 성능 향상을 이끌었으며, 볼 수 있는 카테고리와 볼 수 없는 카테고리 모두에서 일관된 성능 향상을 보였다.
  • 프롬프트 학습에 1개 카테고리당 32개의 샘플을 사용할 경우 최고의 성능을 기록했으며, 더 많은 샘플은 결과를 악화시켜 과적합의 위험을 시사했다.
  • ViT/B-16와 CLIP 사전 훈련을 사용할 경우, COCO Stuff에서 77.5 hIoU의 성능을 기록했으며, ImageNet 사전 훈련 기반 베이스라인보다 뚜렷이 뛰어났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.