Skip to main content
QUICK REVIEW

[논문 리뷰] Few-Shot Panoptic Segmentation With Foundation Models

Markus Käppeler, Kürsat Petek|arXiv (Cornell University)|2023. 09. 19.
Advanced Neural Network ApplicationsComputer Science인용 수 3
한 줄 요약

이 논문은 DINOv2 백본을 동결시켜 단지 10장의 레이블이 부여된 이미지만으로도 고품질의 가짜 레이블을 생성하는 SPINO라는 소수 샘플 패ノ픽 세그멘테이션 방법을 제안한다. 이러한 소수의 레이블을 바탕으로 경량 헤드를 통해 의미 세그멘테이션과 경계 추정을 학습함으로써, SPINO는 완전히 지도 학습된 방법과 경쟁 가능한 가짜 레이블을 생성하며, 도시스케이프에서 단지 훈련 데이터의 0.29%에 해당하는 레이블로 35.9의 PQ를 달성한다.

ABSTRACT

Current state-of-the-art methods for panoptic segmentation require an immense amount of annotated training data that is both arduous and expensive to obtain posing a significant challenge for their widespread adoption. Concurrently, recent breakthroughs in visual representation learning have sparked a paradigm shift leading to the advent of large foundation models that can be trained with completely unlabeled images. In this work, we propose to leverage such task-agnostic image features to enable few-shot panoptic segmentation by presenting Segmenting Panoptic Information with Nearly 0 labels (SPINO). In detail, our method combines a DINOv2 backbone with lightweight network heads for semantic segmentation and boundary estimation. We show that our approach, albeit being trained with only ten annotated images, predicts high-quality pseudo-labels that can be used with any existing panoptic segmentation method. Notably, we demonstrate that SPINO achieves competitive results compared to fully supervised baselines while using less than 0.3% of the ground truth labels, paving the way for learning complex visual recognition tasks leveraging foundation models. To illustrate its general applicability, we further deploy SPINO on real-world robotic vision systems for both outdoor and indoor environments. To foster future research, we make the code and trained models publicly available at http://spino.cs.uni-freiburg.de.

연구 동기 및 목표

  • 대규모 인간 레이블링 데이터셋에 대한 의존도를 줄임으로써 패노픽 세그멘테이션의 높은 레이블링 비용 문제를 해결하고자 한다.
  • 태스크에 종속되지 않는 기초 모델이 패노픽 세그멘테이션에서 소수 샘플 학습을 가능하게 할 수 있는지 탐색하고자 한다.
  • 후행 패노픽 세그멘테이션을 위한 최소한의 지도 학습으로도 고품질의 가짜 레이블을 생성하는 방법을 개발하고자 한다.
  • 로봇 분야에서의 실질적 적용을 가능하게 하여 최소한의 레이블링 노력으로 패노픽 세그멘테이션을 구현하고자 한다.
  • 미래의 소수 샘플 시각 인식 연구를 위한 공개 가능한 프레임워크를 제공하고자 한다.

제안 방법

  • 비디오에서의 자율 학습된, 태스크에 종속되지 않는 시각적 특징을 추출하기 위해 동결된 DINOv2 백본을 사용한다.
  • 10장의 레이블이 부여된 이미지만을 사용하여 의미 세그멘테이션과 경계 추정을 위한 두 개의 경량 헤드 전용 네트워크를 학습한다.
  • 더 큰 수의 원시 레이블이 없는 이미지에 대해 사전에 학습된 헤드를 사용하여 패노픽 가짜 레이블을 생성한다.
  • 가짜 레이블 품질 향상을 위해 데이터 증강(임의의 크롭, 색상 왜곡)과 테스트 시점 증강(다중 해상도 앙상블)을 적용한다.
  • 특징 정제를 위해 MLP를 사용하는 멀티헤드 아키텍처를 사용하며, k-NN, 선형층, CNN보다 더 뛰어난 성능을 보인다.
  • 최적의 가짜 레이블 품질 확보를 위해 배치 크기를 1로 설정하며, 학습률는 비례적으로 조정한다.

실험 결과

연구 질문

  • RQ1DINOv2와 같은 기초 모델이 최소한의 인간 레이블링 데이터만으로도 소수 샘플 패노픽 세그멘테이션을 가능하게 할 수 있는가?
  • RQ2단지 10장의 레이블이 부여된 이미지에서 생성된 가짜 레이블의 품질이 완전히 지도 학습된 기준 모델과 비교해 어떻게 되는가?
  • RQ3낮은 샘플 수 설정에서 가짜 레이블 품질을 극대화하기 위해 어떤 아키텍처 선택과 학습 전략이 가장 효과적인가?
  • RQ4생성된 가짜 레이블이 기존의 어떤 패노픽 세그멘테이션 모델에도 효과적으로 활용될 수 있는가?
  • RQ5이 방법은 다양한 실세계 환경과 데이터셋 간에 얼마나 일반화 가능한가?

주요 결과

  • SPINO는 도시스케이프에서 단지 10장의 레이블이 부여된 이미지만으로도 패노픽 품질(PQ) 35.9를 달성하며, 이는 전체 훈련 세트의 0.29%에 해당한다.
  • 100장의 레이블이 부여된 이미지를 사용할 경우, SPINO는 PQ 42.9에 도달하며, 완전히 지도 학습된 ResNet-50 기준 모델(PQ 43.5)에 근접하는 성능을 보인다.
  • 테스트 시점 다중 해상도 앙상블 추론은 표준 추론 대비 PQ를 10.6점 향상시켜 앙상블 예측의 효과성을 입증한다.
  • k-NN, 선형층, 4층의 CNN보다 SPINO의 가짜 레이블 생성에서 MLP가 가장 뛰어난 성능을 보였다.
  • SPINO가 생성한 가짜 레이블은 도시스케이프, KITTI-360 등의 공개 데이터셋 뿐만 아니라 실내외 환경을 포함한 내부 로봇 데이터셋에서도 경쟁 가능한 성능을 보였다.
  • 단계적 분석 결과, 레이블 수를 1에서 100으로 늘일수록 mIoU, PQ, RQ가 지속적으로 향상되며, 100장 이상이 되면 수익 감소 현상이 나타남을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.