Skip to main content
QUICK REVIEW

[논문 리뷰] Semantic Segmentation In-the-Wild Without Seeing Any Segmentation Examples

Nir Zabari, Yedid Hoshen|arXiv (Cornell University)|2021. 12. 06.
Multimodal Machine Learning Applications인용 수 7
한 줄 요약

이 논문은 이미지 수준의 클래스 기술서만을 사용하여 픽셀 수준의 애너테이션 없이 고품질의 세그멘테이션 마스크를 생성하는 제로샷 세그멘테이션 방법을 제안한다. 이는 CLIP의 시각-언어 임베딩과 테스트 시 증강을 활용하여 이미지 수준의 클래스 기술서에서 허위 레이블을 생성함으로써 이루어지며, 특히 희귀 및 미사용된 카테고리에서 기존의 약한 지도 학습 방법보다 뛰어난 성능을 보인다. 이는 단일 이미지 세그멘테이션 모델에 대해 정련된 관련도 맵을 허위 지도 학습으로 사용함으로써 달성된다.

ABSTRACT

Semantic segmentation is a key computer vision task that has been actively researched for decades. In recent years, supervised methods have reached unprecedented accuracy, however they require many pixel-level annotations for every new class category which is very time-consuming and expensive. Additionally, the ability of current semantic segmentation networks to handle a large number of categories is limited. That means that images containing rare class categories are unlikely to be well segmented by current methods. In this paper we propose a novel approach for creating semantic segmentation masks for every object, without the need for training segmentation networks or seeing any segmentation masks. Our method takes as input the image-level labels of the class categories present in the image; they can be obtained automatically or manually. We utilize a vision-language embedding model (specifically CLIP) to create a rough segmentation map for each class, using model interpretability methods. We refine the maps using a test-time augmentation technique. The output of this stage provides pixel-level pseudo-labels, instead of the manual pixel-level labels required by supervised methods. Given the pseudo-labels, we utilize single-image segmentation techniques to obtain high-quality output segmentation masks. Our method is shown quantitatively and qualitatively to outperform methods that use a similar amount of supervision. Our results are particularly remarkable for images containing rare categories.

연구 동기 및 목표

  • 각 새로운 카테고리에 대해 광범위한 픽셀 수준의 애너테이션을 필요로 하는 지도 학습 세그멘테이션의 높은 비용과 확장성의 한계를 해결하기 위해.
  • 애너테이션된 학습 데이터가 없을 경우에도 희귀 또는 미사용된 개체 카테고리의 세그멘테이션을 가능하게 하기 위해.
  • 수동 픽셀 애너테이션의 필요 없이 이미지 수준의 레이블과 사전 학습된 시각-언어 모델만을 사용하여 정확한 세그멘테이션 마스크를 생성하는 방법을 개발하기 위해.
  • 희귀 클래스 분포와 긴 꼬리 분포에서의 성능을 향상시키기 위해 수동 지도 학습을 자동으로 생성된 허위 레이블로 대체함으로써.

제안 방법

  • 이 방법은 각 카테고리의 설명을 담은 텍스트 프롬프트와 이미지 특징 간의 어텐션 활성화를 해석하여, 각 카테고리별 관련도 맵을 생성하기 위해 CLIP을 사용한다.
  • 노이즈가 있는 관련도 맵의 정밀도를 향상시키고 국소화 정확도를 높이기 위해, 다양한 이미지 뷰(예: 자르기, 뒤집기, 대trast 조정)를 사용한 테스트 시 증강(TTA)을 적용한다.
  • 정련된 각 카테고리별 관련도 맵을 조합하여 다중 카테고리 세그멘테이션 맵을 생성하며, 이는 후속 세그멘테이션 모델의 픽셀 수준의 허위 레이블로 기능한다.
  • 이러한 허위 레이블은 수동 애너테이션을 대체하여 무 supervision 클러스터링 또는 인터랙티브 세그멘테이션 모델을 초기화하는 데 사용된다.
  • 이분화보다 불확실성을 더 잘 다루기 위해 하드 이진화 대신 확률적 샘플링을 사용함으로써 세그멘테이션 품질을 향상시킨다.
  • 이 방법은 어떤 단일 이미지 세그멘테이션 모델과도 호환되며, 플러그인 허위 지도 학습 모듈로 기능한다.

실험 결과

연구 질문

  • RQ1CLIP과 같은 시각-언어 모델이 픽셀 수준의 지도 학습 없이 정확한 가짜 세그멘테이션 마스크를 효과적으로 생성할 수 있는가?
  • RQ2테스트 시 증강이 CLIP의 어텐션 메커니즘에서 유도된 관련도 맵의 품질을 어떻게 향상시키는가?
  • RQ3정련된 CLIP 기반 관련도 맵이 단일 이미지 세그멘테이션 모델에 대해 효과적인 허위 지도 학습으로 기능할 수 있는가?
  • RQ4기존의 약한 지도 학습 또는 소수 샘플 학습 방법과 비교해 이 방법은 희귀 또는 긴 꼬리 분포 카테고리에서 어떻게 성능을 내는가?
  • RQ5증강 전략, 이진화 임계값, 샘플링 방법과 같은 설계 선택 사항 중에서 세그멘테이션 성능에 가장 큰 영향을 미치는 것은 무엇인가?

주요 결과

  • 이 방법은 유사한 수준의 지도 학습을 사용하는 다른 방법들과 비교해 표준 벤치마크에서 뛰어난 정량적 성능을 달성하며, 특히 희귀 카테고리에서 두각을 나타낸다.
  • 테스트 시 증강은 세그멘테이션 품질을 크게 향상시키며, 자르기 뷰가 가장 큰 기여를 하며, 모든 뷰를 함께 사용할 경우 성능 향상이 더욱 두드러진다.
  • 허위 레이블의 확률적 샘플링은 하드 이진화보다 성능이 뛰어나며, CLIP의 관련도 맵에 존재하는 불확실성과 노이즈를 더 잘 다룬다.
  • 3개의 자동으로 생성된 클릭을 사용한 인터랙티브 세그멘테이션은 무 supervision 클러스터링보다 더 좋은 결과를 내며, 둘 다 허위 지도 학습에서 크게 이점을 얻는다.
  • qualitative 결과를 통해 희귀 및 고유한 카테고리에 대해 강건함을 입증하였으며, PASCAL VOC와 실제 환경 이미지에서 희귀 클래스를 포함한 이미지에서 확인되었다.
  • 제거 분석을 통해 CLIP 기반 관련도 맵 생성과 TTA 정련이 높은 성능을 내기 위해 필수적인 구성 요소임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.