Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Semantic Segmentation with Self-supervised Object-centric Representations

Andrii Zadaianchuk, Matthaeus Kleindessner|arXiv (Cornell University)|2022. 07. 11.
Advanced Image and Video Retrieval Techniques인용 수 16
한 줄 요약

이 논문은 DINO에서 유도한 객체 중심 표현과 비지도 성과 감지 기반으로 학습된 흑백 마스크를 생성하는 자기지도 학습 방법인 COMUS를 제안한다. 이는 PASCAL VOC에서 최고 성능(50.0 mIoU)을 달성하였으며, 이전에 이 분야에서 다뤄지지 않은 81개 클래스를 모두 포함하는 MS COCO 데이터셋에 대해 처음으로 비지도 세분화 결과를 보고한다. 평균 mIoU는 19.6이며, 34개의 클래스에서 20% 이상의 IoU를 달성하였다.

ABSTRACT

In this paper, we show that recent advances in self-supervised feature learning enable unsupervised object discovery and semantic segmentation with a performance that matches the state of the field on supervised semantic segmentation 10 years ago. We propose a methodology based on unsupervised saliency masks and self-supervised feature clustering to kickstart object discovery followed by training a semantic segmentation network on pseudo-labels to bootstrap the system on images with multiple objects. We present results on PASCAL VOC that go far beyond the current state of the art (50.0 mIoU), and we report for the first time results on MS COCO for the whole set of 81 classes: our method discovers 34 categories with more than $20\%$ IoU, while obtaining an average IoU of 19.6 for all 81 categories.

연구 동기 및 목표

  • 인간 레이블이 전혀 없는 조건에서 비지도 세분화를 위한 단순하면서도 강력한 베이스라인을 개발하는 것.
  • 자기지도 학습 기반 표현을 활용해 다중 객체 이미지에서 객체 카테고리의 자동 발견과 정확한 국소화를 가능하게 하는 것.
  • 이전에 이 분야에서 다뤄지지 않은 바와 같이, MS COCO와 같은 대규모 데이터셋(81개 클래스 모두 포함)에 비지도 세분화를 확장하는 것.
  • 비지도 방법이 10년 전의 지도 학습 방법 수준의 성능에 도달할 수 있음을 입증하는 것.
  • 향후 향상 가능성을 위한 핵심 구성 요소와 성능 저하 요인을 추론하기 위해 분석 실험을 수행하는 것.

제안 방법

  • ImageNet에서 레이블 없이도 고품질의 객체 중심 특징을 추출하기 위해 자기지도 학습 기반의 비전 트랜스포머인 DINO를 활용한다.
  • 전경 객체를 국소화하고 영역 제안을 추출하기 위해 비지도 성과 감지기(DeepUSPS 또는 BASNet)를 적용한다.
  • 성과 감지 영역 내부의 DINO 특징에 대해 스펙트럼 클러스터링을 적용하여 객체 카테고리 발굴 및 가짜 마스크 생성을 수행한다.
  • 불확실한 클러스터를 필터링하여 가짜 레이블의 노이즈를 줄이고 마스크 품질을 향상시킨다.
  • 데이터 증강 기반의 자기학습을 통해 생성된 가짜 마스크를 기반으로 DeepLabv3 세분화 네트워크를 훈련시킨다.
  • PASCAL VOC 및 MS COCO에서 예측을 개선하고 세분화 품질을 향상시키기 위해 반복적인 자기학습을 수행한다.

실험 결과

연구 질문

  • RQ1자기지도 학습 기반의 객체 중심 표현이 인간 레이블 없이도 강력한 비지도 세분화를 가능하게 할 수 있는가?
  • RQ2비지도 성과 감지와 특징 클러스터링의 조합이 복잡한 다중 객체 장면에서 객체 발견에 얼마나 효과적인가?
  • RQ381개 클래스를 포함한 MS COCO와 같은 데이터셋에서 가짜 마스크 기반 자기학습 루프가 세분화 성능 향상에 얼마나 기여하는가?
  • RQ4성능에 가장 큰 영향을 미치는 핵심 구성 요소는 무엇이며, 향후 향상의 주요 저하 요인은 어디인가?
  • RQ5비지도 세분화 방법이 10년 전의 지도 학습 방법 수준의 성능에 도달할 수 있는가?

주요 결과

  • COMUS는 PASCAL VOC에서 50.0 mIoU를 기록하여 10년 전의 지도 학습 세분화 방법과 동일한 성능를 달성하였다.
  • 이 논문은 처음으로 전체 81개 클래스를 포함하는 MS COCO 데이터셋에 대해 비지도 세분화 결과를 보고하였으며, 평균 mIoU는 19.6이다.
  • MS COCO에서 34개의 객체 카테고리를 20% 이상의 IoU로 성공적으로 발굴하여 다중 객체 및 다중 카테고리 발굴 능력이 뛰어나다는 것을 입증하였다.
  • 분석 실험 결과, 비지도 성과 감지와 DINO 특징에 대한 스펙트럼 클러스터링이 초기 마스크 품질 및 카테고리 발굴에 핵심적인 역할을 한다는 것이 확인되었다.
  • 자기학습이 성능 향상에 크게 기여하였으며, PASCAL VOC에서는 두 번의 반복, MS COCO에서는 한 번의 반복으로 일관된 성능 향상이 관찰되었다.
  • 계산 비용은 DINO 사전학습(8개 GPU에서 3일)에 의해 주로 차지하지만, 추론 및 후속 훈련은 효율적이며, 전체 자기학습 과정은 4개의 T4 GPU에서 약 1시간이 소요된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.