Skip to main content
QUICK REVIEW

[논문 리뷰] DatasetGAN: Efficient Labeled Data Factory with Minimal Human Effort

Yuxuan Zhang, Huan Ling|arXiv (Cornell University)|2021. 04. 13.
Advanced Neural Network Applications참고 문헌 53인용 수 17
한 줄 요약

DatasetGAN은 사전 훈련된 StyleGAN을 활용해 이미지를 합성하고, 가벼운 디코더를 통해 몇 개의 인간 레이블 예시만으로도 픽셀 단위의 레이블을 예측함으로써 고품질의 세분화된 세그먼테이션 데이터셋을 생성한다. 이 방법은 상태의 성능을 내는 세그먼테이션 및 키포인트 검출을 가능하게 하며, 완전히 감독된 모델이 요구하는 100분의 1 이하의 레이블 데이터로도 성능을 달성한다.

ABSTRACT

We introduce DatasetGAN: an automatic procedure to generate massive datasets of high-quality semantically segmented images requiring minimal human effort. Current deep networks are extremely data-hungry, benefiting from training on large-scale datasets, which are time consuming to annotate. Our method relies on the power of recent GANs to generate realistic images. We show how the GAN latent code can be decoded to produce a semantic segmentation of the image. Training the decoder only needs a few labeled examples to generalize to the rest of the latent space, resulting in an infinite annotated dataset generator! These generated datasets can then be used for training any computer vision architecture just as real datasets are. As only a few images need to be manually segmented, it becomes possible to annotate images in extreme detail and generate datasets with rich object and part segmentations. To showcase the power of our approach, we generated datasets for 7 image segmentation tasks which include pixel-level labels for 34 human face parts, and 32 car parts. Our approach outperforms all semi-supervised baselines significantly and is on par with fully supervised methods, which in some cases require as much as 100x more annotated data as our method.

연구 동기 및 목표

  • 세그먼테이션을 위한 대규모이고 세밀하게 레이블링된 이미지 데이터셋을 만들기 위한 높은 비용과 노동 강도 문제를 해결하기 위해.
  • 생성 모델을 활용해 이미지와 해당하는 세그먼테이션 레이블을 합성함으로써 광범위한 인간 레이블링의 필요성을 줄이기 위해.
  • 실제 데이터에 훈련된 완전 감독 모델의 성능을 따라하거나 초월하는 성능을 내는 합성 데이터셋을 통해 딥 러닝 모델을 훈련시키기 위해.
  • 3D 재구성 및 가동 가능한 오브제 모델링과 같은 복잡한 최종 응용 프로그램을 지원하기 위해 부분 수준 및 키포인트 레이블을 풍부하게 제공하기 위해.
  • 오직 16~30개의 인간 레이블링 예시만으로도 다양한 세그먼테이션 작업에 잘 일반화되는 모델을 훈련시킬 수 있음을 입증하기 위해.

제안 방법

  • 잠재 공간 전반에 걸쳐 다양한 실사 이미지를 생성하기 위해 사전 훈련된 StyleGAN을 활용한다.
  • 합성된 이미지 중 소수의 부분(예: 16~30개)을 인간이 밀도 있는 픽셀 단위의 세그먼테이션 레이블로 수동으로 레이블링한다.
  • 가벼운 얕은 디코더 네트워크를 훈련시켜 GAN의 잠재 코드를 세그먼테이션 마스크로 매핑함으로써 전체 잠재 공간으로 일반화한다.
  • 훈련된 디코더를 사용해 무한한 수의 합성된, 완전히 레이블링된 이미지-세그먼테이션 쌍을 자동으로 생성한다.
  • 합성 데이터셋을 사용해 최종 응용 프로그램용 컴퓨터 비전 모델을 훈련시키고, 실제 테스트 데이터에서 성능을 평가한다.
  • 다양한 렌더링과 2D 감독을 통합하여, 이 프레임워크를 3D 파트 세그먼테이션 및 3D 키포인트 예측으로 확장한다.

실험 결과

연구 질문

  • RQ1GAN에 의해 생성된 분포에서 유도된 소수의 인간 레이블링된 이미지를 사용해, 전체 잠재 공간으로 일반화되는 디코더를 훈련시킬 수 있는가?
  • RQ2이 방법으로 생성된 합성 데이터셋이 실재 데이터에 훈련된 완전 감독 모델의 성능을 어느 정도 따라하거나 초월할 수 있는가?
  • RQ3이 방법은 인간의 노력 최소화로도 세분화된 레이블(예: 34개의 얼굴 부위, 32개의 자동차 부위)을 효과적으로 생성할 수 있는가?
  • RQ4이 방법은 단일 이미지에서의 키포인트 검출 및 3D 재구성과 같은 최종 응용 작업에서 얼마나 효과적인가?
  • RQ5이 방법은 파트 수준 및 키포인트 감독을 통해 애니메이션 가능한 3D 자산 생성과 같은 복잡한 3D 응용 프로그램을 지원할 수 있는가?

주요 결과

  • DatasetGAN은 얼굴 및 자동차 부위 세그먼테이션을 포함한 7개의 세그먼테이션 작업에서 모든 준감독 학습 베이스라인보다 뚜렷이 뛰어난 성능을 보였다.
  • 어떤 경우에서는 레이블링 데이터의 1/100 밖에 사용하지 않아도, 완전 감독 모델과 동등한 성능을 달성했다.
  • CUB 새 데이터셋에서, 30개의 인간 레이블링 예시로 합성 데이터에 훈련된 모델이 동일한 레이블링 예산을 사용한 미세조정된 베이스라인을 뛰어넘는 성능을 보였다.
  • 자동차 키포인트 검출 작업에서, 레이블링된 예시가 16개뿐인 합성 데이터에 훈련된 모델이 20개의 실제 테스트 이미지에서 강력한 성능을 보였다.
  • 이 방법을 통해 단지 30개의 인간 레이블링 예시만으로도 단일 이미지에서 애니메이션 가능한 3D 자동차를 최초로 3D 재구성했으며, 래핑된 바퀴, 정확한 재질, 동적 조명을 구현했다.
  • 이 프레임워크는 고품질의 세분화된 파트 수준 및 키포인트 레이블을 성공적으로 생성하여 물리 및 애니메이션 지원 기능을 갖춘 현실적인 3D 자산 생성을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.