[논문 리뷰] BigDatasetGAN: Synthesizing ImageNet with Pixel-wise Annotations
이 논문은 BigGAN에서 1개 클래스당 수동으로 주석 처리된 이미지 5장만을 사용하여 대규모로 고해상도 마스크가 부여된 ImageNet 데이터셋을 합성하는 BigDatasetGAN을 제안한다. 이러한 소량의 레이블이 부여된 GAN 샘플에 대해 세그멘테이션 헤드를 훈련시킴으로써, 정확한 마스크를 갖춘 고품질의 합성 이미지를 생성할 수 있으며, 이는 사전 훈련에 사용될 경우 후속 세그멘테이션 및 검출 작업에서 최신 기술 수준의 성능을 달성할 수 있다.
Annotating images with pixel-wise labels is a time-consuming and costly process. Recently, DatasetGAN showcased a promising alternative - to synthesize a large labeled dataset via a generative adversarial network (GAN) by exploiting a small set of manually labeled, GAN-generated images. Here, we scale DatasetGAN to ImageNet scale of class diversity. We take image samples from the class-conditional generative model BigGAN trained on ImageNet, and manually annotate 5 images per class, for all 1k classes. By training an effective feature segmentation architecture on top of BigGAN, we turn BigGAN into a labeled dataset generator. We further show that VQGAN can similarly serve as a dataset generator, leveraging the already annotated data. We create a new ImageNet benchmark by labeling an additional set of 8k real images and evaluate segmentation performance in a variety of settings. Through an extensive ablation study we show big gains in leveraging a large generated dataset to train different supervised and self-supervised backbone models on pixel-wise tasks. Furthermore, we demonstrate that using our synthesized datasets for pre-training leads to improvements over standard ImageNet pre-training on several downstream datasets, such as PASCAL-VOC, MS-COCO, Cityscapes and chest X-ray, as well as tasks (detection, segmentation). Our benchmark will be made public and maintain a leaderboard for this challenging task. Project Page: https://nv-tlabs.github.io/big-datasetgan/
연구 동기 및 목표
- ImageNet과 같은 대규모 데이터셋의 수동 고해상도 마스크 주석 처리에 따른 높은 비용과 노력 문제를 해결하기 위해.
- 클래스 조건부 GAN 기반의 DatasetGAN 프레임워크를 1,000개 클래스를 갖는 전체 ImageNet으로 확장하기 위해.
- 합성 및 실재 주석 처리 이미지를 모두 활용하여 세그멘테이션에 대한 새로운 벤치마크를 만들기 위해.
- 밀도 높은 예측 작업에서 백본 모델의 사전 훈련을 위한 합성 데이터의 효과를 평가하기 위해.
- BigGAN과 VQGAN에서 유도된 합성 데이터가 표준 ImageNet 사전 훈련보다 후속 벤치마크에서 더 뛰어난 성능을 내는지 입증하기 위해.
제안 방법
- BigGAN에서 1개 클래스당 5장의 이미지를 추출하고, 전문가 1명이 고해상도 마스크로 수동으로 주석 처리한다.
- 소량의 주석 처리된 데이터셋을 기반으로 GAN의 특징 맵에 대해 세그멘테이션 헤드(특징 해석기 브랜치)를 훈련시킨다.
- 훈련된 모델을 활용해 이미지와 해당하는 마스크를 함께 갖는 대규모 합성 데이터셋을 생성한다.
- 이 방법을 VQGAN로 확장하여, 추가 주석 처리 없이도 VQGAN가 레이블이 부여된 데이터 생성기로 활용될 수 있음을 보여준다.
- 합성 데이터셋을 활용해 후속 작업에서 세그멘테이션 및 검출 모델의 사전 훈련을 수행한다.
- 실재 및 합성 데이터에 대한 세그멘테이션 성능 평가를 위한 공개 벤치마크와 랭킹을 운영한다.

실험 결과
연구 질문
- RQ1소량의 수동 주석 처리된 GAN 생성 이미지를 기반으로 한 세그멘테이션 헤드가 ImageNet 규모의 고품질 합성 데이터 생성에 일반화될 수 있는가?
- RQ2BigGAN에서 유도된 합성 고해상도 마스크가 부여된 데이터로 사전 훈련한 결과가 후속 세그멘테이션 및 검출 작업에서 표준 ImageNet 사전 훈련과 비교해 어떻게 성능을 내는가?
- RQ3VQGAN가 추가 주석 처리 없이 고해상도 세그멘테이션을 위한 데이터 생성기로 얼마나 효과적으로 활용될 수 있는가?
- RQ4BigGAN 및 VQGAN에서 생성된 합성 마스크의 품질은 실재 주석 처리 마스크와 비교해 형태 다양성과 정확도 측면에서 어떻게 되는가?
- RQ5밀도 높은 예측 작업에서 합성 데이터가 자기지도 학습 및 지도 학습 사전 훈련에 어떤 영향을 미치는가?
주요 결과
- BigDatasetGAN가 생성한 합성 데이터로 사전 훈련을 수행하면, PASCAL-VOC, MS-COCO, Cityscapes 및 흉부 X-ray 데이터셋에서 표준 ImageNet 사전 훈련보다 성능 향상이著명하다.
- BigGAN에서 유도한 합성 데이터셋은 세그멘테이션 벤치마크에서 최신 기술 수준의 성능을 달성했으며, 실재 ImageNet으로 사전 훈련한 모델보다 후속 작업에서 미세조정 시 더 뛰어난 성능을 보였다.
- VQGAN-sim는 BigGAN-sim에 비해 객체의 크기, 자세, 배경 측면에서 더 높은 다양성을 보였지만, 마스크 정확도는 略로 낮았다.
- 형태 다양성 지표 분석 결과, BigGAN-sim는 특히 동물 클래스에서 의미 있는 형태 변화를 잘 포착했으며, k-means 군집화 분석을 통해 명확한 객체 모드가 드러났다.
- 전이 학습 실험 결과, 합성 데이터가 다양한 백본 아키텍처와 학습 철학(자기지도 학습 및 지도 학습) 전반에서 성능 향상을 이끌어냈다.
- 실재 주석 처리 이미지가 포함된 벤치마크 결과는 합성 데이터의 유용성을 확인했으며, 공개 랭킹을 통해 지속적인 평가 및 성과 추적을 가능하게 했다.
![Figure 3 : Architecture of BigDatasetGAN based on BigGAN [ 6 ] .](https://ar5iv.labs.arxiv.org/html/2201.04684/assets/x3.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.