[論文レビュー] BigDatasetGAN: Synthesizing ImageNet with Pixel-wise Annotations
本稿では、BigGANからクラスあたり5枚の手動でアノテートされた画像のみを用いて、大規模でピクセル単位のアノテーションが施されたImageNetデータセットを合成するBigDatasetGANという手法を提案する。これらの少数のラベル付きGANサンプル上でセマンティックセグメンテーションヘッドを訓練することで、正確なマスクを伴う高品質な合成画像を生成でき、そのデータを事前学習に用いることで、下流のセグメンテーションおよび検出タスクで最先端の性能を達成する。
Annotating images with pixel-wise labels is a time-consuming and costly process. Recently, DatasetGAN showcased a promising alternative - to synthesize a large labeled dataset via a generative adversarial network (GAN) by exploiting a small set of manually labeled, GAN-generated images. Here, we scale DatasetGAN to ImageNet scale of class diversity. We take image samples from the class-conditional generative model BigGAN trained on ImageNet, and manually annotate 5 images per class, for all 1k classes. By training an effective feature segmentation architecture on top of BigGAN, we turn BigGAN into a labeled dataset generator. We further show that VQGAN can similarly serve as a dataset generator, leveraging the already annotated data. We create a new ImageNet benchmark by labeling an additional set of 8k real images and evaluate segmentation performance in a variety of settings. Through an extensive ablation study we show big gains in leveraging a large generated dataset to train different supervised and self-supervised backbone models on pixel-wise tasks. Furthermore, we demonstrate that using our synthesized datasets for pre-training leads to improvements over standard ImageNet pre-training on several downstream datasets, such as PASCAL-VOC, MS-COCO, Cityscapes and chest X-ray, as well as tasks (detection, segmentation). Our benchmark will be made public and maintain a leaderboard for this challenging task. Project Page: https://nv-tlabs.github.io/big-datasetgan/
研究の動機と目的
- ImageNetのような大規模データセットにおけるピクセル単位の手動アノテーションの高コストと人的負荷を軽減すること。
- クラス条件付きGANに基づくDatasetGANフレームワークを、1,000クラスあるImageNet全体にスケールアップすること。
- 合成画像と実際のアノテーション画像を併用した新しいセマンティックセグメンテーションのベンチマークを構築すること。
- 密集予測タスクにおけるバックボーンモデルの事前学習に向けた合成データの有効性を評価すること。
- BigGANおよびVQGANからの合成データが、下流ベンチマークにおいて標準的なImageNet事前学習を上回ることを実証すること。
提案手法
- BigGANからクラスあたり5枚の画像をサンプリングし、専門家1名による手動でピクセル単位のマスクを付与する。
- 小規模なアノテート済みデータセットを用いて、GANの特徴マップ上でセグメンテーションヘッド(特徴解釈ブランチ)を訓練する。
- 訓練済みモデルを用いて、画像と対応するマスクを併せ持つ大規模な合成データセットを生成する。
- この手法をVQGANに拡張し、追加のアノテーションなしに、VQGANがラベル付きデータ生成器として機能できることを示す。
- 合成データセットを用いて、下流タスクにおけるセグメンテーションおよび検出モデルの事前学習を実施する。
- 実際のアノテーション画像と合成画像の両方を用いたパブリックベンチマークとリーダーボードを提供し、セグメンテーション性能を評価する。

実験結果
リサーチクエスチョン
- RQ1少数の手動アノテート済みGAN生成画像を用いて訓練したセグメンテーションヘッドは、ImageNetスケールの高品質な合成データ生成に一般化可能か?
- RQ2BigGANからの合成でピクセル単位のラベルが付与されたデータで事前学習した場合、下流のセグメンテーションおよび検出タスクにおいて、標準的なImageNet事前学習と比較してどの程度優れるか?
- RQ3VQGANは追加のアノテーションなしに、ピクセル単位のセグメンテーション用データ生成器としてどの程度活用可能か?
- RQ4BigGANおよびVQGANから得られる合成マスクの品質は、実際のアノテーションマスクと比較して、形状の多様性と正確性の観点でどの程度か?
- RQ5密集予測タスクにおける自己教師ありおよび教師あり事前学習において、合成データの影響は何か?
主な発見
- BigDatasetGANが生成する合成データで事前学習をすると、PASCAL-VOC、MS-COCO、Cityscapes、および胸部X線データセットにおいて、標準的なImageNet事前学習を大きく上回る性能向上が得られる。
- BigGANから生成された合成データセットは、下流タスクでの微調整時に、実際のImageNetで事前学習したモデルを上回る、セマンティックセグメンテーションベンチマークで最先端の性能を達成する。
- VQGAN-simは、物体のスケール、ポーズ、背景の面でBigGAN-simよりも多様な画像を生成するが、マスク品質はわずかに低い。
- 形状多様性指標の結果から、BigGAN-simは特に動物のクラスにおいて意味のある形状変異を捉えており、k-meansクラスタリングにより明確な物体モードが特定されている。
- トランスファーラーニングの実験から、合成データは自己教師ありおよび教師あり事前学習の両方の学習パラダイムにおいて、複数のバックボーンアーキテクチャで性能向上をもたらすことが示された。
- 実際のアノテーション画像を用いたベンチマークは、合成データの有効性を裏付け、パブリックリーダーボードにより継続的な評価と進捗追跡が可能である。
![Figure 3 : Architecture of BigDatasetGAN based on BigGAN [ 6 ] .](https://ar5iv.labs.arxiv.org/html/2201.04684/assets/x3.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。