Skip to main content
QUICK REVIEW

[논문 리뷰] Scaling up Multi-domain Semantic Segmentation with Sentence Embeddings

Wei Yin, Yifan Liu|arXiv (Cornell University)|2022. 02. 04.
Domain Adaptation and Few-Shot Learning인용 수 7
한 줄 요약

이 논문은 Wikipedia에서 검색한 서술문의 문장 임베딩으로 클래스 레이블을 대체하는 제로샷 세분화 방법을 제안한다. 이는 수동 레이블 정렬 없이 다중 도메인 데이터셋을 자동으로 통합할 수 있게 하며, 이질적인 손실 함수를 사용해 9개의 다양한 데이터셋에서 200만 장 이상의 이미지로 훈련함으로써 제로샷 및 피니팅 설정에서 7개의 벤치마크 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성한다. 이는 PASCAL-Context에서 65% mIoU와 COCO 인스턴스 세분화에서 45.5% AP를 기록한다.

ABSTRACT

We propose an approach to semantic segmentation that achieves state-of-the-art supervised performance when applied in a zero-shot setting. It thus achieves results equivalent to those of the supervised methods, on each of the major semantic segmentation datasets, without training on those datasets. This is achieved by replacing each class label with a vector-valued embedding of a short paragraph that describes the class. The generality and simplicity of this approach enables merging multiple datasets from different domains, each with varying class labels and semantics. The resulting merged semantic segmentation dataset of over 2 Million images enables training a model that achieves performance equal to that of state-of-the-art supervised methods on 7 benchmark datasets, despite not using any images therefrom. By fine-tuning the model on standard semantic segmentation datasets, we also achieve a significant improvement over the state-of-the-art supervised segmentation on NYUD-V2 and PASCAL-context at 60% and 65% mIoU, respectively. Based on the closeness of language embeddings, our method can even segment unseen labels. Extensive experiments demonstrate strong generalization to unseen image domains and unseen labels, and that the method enables impressive performance improvements in downstream applications, including depth estimation and instance segmentation.

연구 동기 및 목표

  • 고정된 클래스 집합을 가진 단일 도메인 데이터셋에서 훈련된 지도 학습 세분화 모델의 한계를 극복하기 위해.
  • 재훈련이나 수동 애너테이션 없이도 새로운 클래스와 이미지 도메인으로의 제로샷 일반화를 가능하게 하기 위해.
  • 충돌하는 레이블 분류 체계를 가진 이질적인 세분화 데이터셋을 자동으로 통합하기 위해.
  • 가짜 레이블 데이터를 활용해 디프스티메이션 및 인스턴스 세분화와 같은 후행 작업의 성능을 향상시키기 위해.
  • 언어 기반 레이블 임베딩이 전통적인 클래스 레이블의 확장 가능한 일반 목적의 대안이 될 수 있음을 보여주기 위해.

제안 방법

  • 각 클래스 레이블을 위키피디아에서 검색한 서술문의 밀도 높은 벡터 임베딩으로 대체한다.
  • 이미지 모odaliti를 사용하지 않고 CLIP의 텍스트 인코더를 사용해 문장 임베딩을 생성한다.
  • 9개의 다양한 데이터셋을 통합한 데이터셋에서 훈련하여, 일관된 의미 레이블을 가진 200만 장 이상의 이미지를 활용한다.
  • 약한 애너테이션 데이터셋(예: Objects365, OpenImages)과 노이즈 있는 애너테이션을 효과적으로 활용하기 위해 이질적인 손실 함수를 도입한다.
  • 새로운 클래스 설명의 임베딩을 계산하고 모델의 임베딩 공간과 매칭함으로써 제로샷 추론을 가능하게 한다.
  • 추론 또는 훈련 중에 특징 맵에 언어 임베딩을 삽입함으로써 학습된 표현을 후행 작업으로 전이한다.

실험 결과

연구 질문

  • RQ1문장 임베딩이 다양한 도메인 간 제로샷 세분화를 가능하게 하기 위해 전통적인 클래스 레이블을 대체할 수 있는가?
  • RQ2문장 임베딩을 사용해 여러 데이터셋을 통합하면, 새로운 데이터셋에서의 일반화 및 성능 향상이 이루어지는가?
  • RQ3훈련 데이터셋에 존재하지 않는 새로운 클래스로도 모델이 일반화할 수 있는가?
  • RQ4제안된 이질적인 손실 함수가 약한 애너테이션 및 노이즈 있는 데이터셋을 얼마나 효과적으로 활용하는가?
  • RQ5이 방법이 디프스티메이션 및 인스턴스 세분화와 같은 후행 작업에서 성능 향상에 얼마나 기여하는가?

주요 결과

  • 완전히 지도 학습된 피니팅 설정에서 NYUD-V2에서 60% mIoU, PASCAL-Context에서 65% mIoU를 달성하여 이전 SOTA를 초월한다.
  • 7개의 도메인 간 벤치마크 데이터셋에서, 해당 데이터셋의 훈련 이미지를 전혀 사용하지 않고도 최신 기술 수준의 제로샷 성능을 달성한다.
  • qualitative 예시에서 '오리'와 '사슴'과 같이 이전에 본 적이 없는 레이블의 제로샷 세분화가 가능하다.
  • Objects365에서 유도된 가짜 레이블을 사용해 COCO에서 피니팅할 경우, 인스턴스 세분화 성능이 약 4% AP 향상되며, COCO 데이터의 50%만 사용해도 베이스라인 CondInst를 능가한다.
  • 문장 임베딩에서 유도된 가짜 세분화 레이블을 사용할 경우, 제로샷 9개 데이터셋에서 단일 카메라 깊이 추정 성능이 일관되게 향상된다.
  • 문장 임베딩의 유사도 행렬은 단어 임베딩보다 더 나은 의미 클러스터링을 보여주며, 향상된 의미 정렬을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.