[論文レビュー] MineGAN: effective knowledge transfer from GANs to target domains with few images
MineGAN は、少量の画像でターゲットドメインに最も類似した領域へ生成モデルの潜在空間を誘導する軽量なマイナー ネットワークを用いた、生成モデル向けの新規な知識移行手法を提案する。微調整の前段階で関連する潜在空間領域をマイニングすることで、MineGAN は過学習とモード崩壊を低減し、非条件・条件・マルチ GAN の設定において、FID および KMMD スコアで既存手法を上回る性能を発揮する。
One of the attractive characteristics of deep neural networks is their ability to transfer knowledge obtained in one domain to other related domains. As a result, high-quality networks can be trained in domains with relatively little training data. This property has been extensively studied for discriminative networks but has received significantly less attention for generative models. Given the often enormous effort required to train GANs, both computationally as well as in the dataset collection, the re-use of pretrained GANs is a desirable objective. We propose a novel knowledge transfer method for generative models based on mining the knowledge that is most beneficial to a specific target domain, either from a single or multiple pretrained GANs. This is done using a miner network that identifies which part of the generative distribution of each pretrained GAN outputs samples closest to the target domain. Mining effectively steers GAN sampling towards suitable regions of the latent space, which facilitates the posterior finetuning and avoids pathologies of other methods such as mode collapse and lack of flexibility. We perform experiments on several complex datasets using various GAN architectures (BigGAN, Progressive GAN) and show that the proposed method, called MineGAN, effectively transfers knowledge to domains with few target images, outperforming existing methods. In addition, MineGAN can successfully transfer knowledge from multiple pretrained GANs. Our code is available at: https://github.com/yaxingwang/MineGAN.
研究の動機と目的
- 少量の画像でのターゲットドメインに事前学習 GAN からの知識を移行する課題に取り組む。既存手法はモード崩壊と過学習の問題に直面している。
- 全生成器パラメータを更新する従来の微調整アプローチの限界を克服する。これは、小規模なターゲットデータセットにおいて不安定さと一般化性能の低下を引き起こす。
- 単一の事前学習 GAN からの移行に加え、複数の GAN からの知識移行を可能にし、相補的な情報を統合してより優れた生成性能を実現する。
- 完全微調整の柔軟性を保ちつつ、データ駆動の潜在空間の標的領域への集中サンプリングによって過学習を低減する手法を開発する。
- 反復的最適化を回避するフォワードパス推論パイプラインを設計し、DGN-AM や PPGN のような反復的手法と比較して、実世界の展開に実用的である。
提案手法
- 事前学習 GAN の入力空間に、標準正規分布を写像する軽量なマイナー ネットワークを導入し、生成サンプルがターゲットドメインに最も近くなるようにする。
- ターゲット分布からの少数の実画像を用いて、潜在空間におけるターゲットドメインへの近接性を最適化する選択的バックプロパゲーション手順でマイナー ネットワークを訓練する。
- マイナーを用いて、ターゲットドメインと統計的・意味論的に類似した領域に限定して、事前学習 GAN の潜在空間からのサンプリングを誘導する。
- マイニングされた潜在コードのみを用いて生成器の事後微調整を実施し、学習信号の分散を低減し、モード崩壊を緩和する。
- 複数の事前学習 GAN に対して、マイナーを介して出力を統合する方法を拡張し、多様なソース分布間での知識集約を可能にする。
- 生成時に反復的最適化を回避することで、推論をフォワードパスかつ効率的に行い、DGN-AM や PPGN のような反復的手法とは異なり、実用的である。
実験結果
リサーチクエスチョン
- RQ1軽量なマイナー ネットワークは、少量の実画像でのみターゲットドメインに類似した生成を可能にする潜在空間の領域を効果的に特定・誘導できるか?
- RQ2微調整の前段階で最も関連性の高い潜在空間領域をマイニングすることで、標準的な微調整と比較して生成品質が向上し、過学習が低減するか?
- RQ3MineGAN は複数の事前学習 GAN から単一のターゲットドメインへの知識移行を成功させられ、単一 GAN 移行と比較して性能が向上するか?
- RQ4BigGAN のような高品質 GAN に適用した場合、MineGAN は DGN-AM や PPGN のような反復的手法と比較して、推論速度と生成品質の両面で優れているか?
- RQ5MineGAN は、ImageNet から Places365 への移行のように、マニフォールド上およびマニフォールド外の分布シフトに対しても一般化可能か?
主な発見
- MineGAN は非条件および条件付き GAN 移行において、SOTA の性能を達成し、マニフォールド外およびマニフォールド内での ImageNet から Places365 への移行において、それぞれ FID スコア 78.4 および 52.3 を達成した。
- MineGAN は、FID および KMMD の両指標で、TransferGAN や DGN-AM、PPGN を上回った。特に、ラベルサポートが欠如するため失敗する可能性がある挑戦的なマニフォールド外設定において顕著な優位性を示した。
- 推論時間を 1 イメージあたり約 5.2ms にまで短縮し、DGN-AM(3020ms)や PPGN(3830ms)のような反復的手法と比較して、3 時代分以上高速化した。
- DGN-AM や PPGN が生成にクラスラベルを必要とするのに対し、MineGAN はターゲットドメインのラベルを使用せずに優れた結果を達成した。
- マイナー ネットワークは、ターゲットドメイン「タワー」に対して、例えば「ブリッジ GAN」と「チャーチ GAN」の関連するソース GAN を効果的に同定した。
- MineGAN は、BigGAN や Progressive GAN、SNGAN といった多様な GAN アーキテクチャにおいて、少数のショットターゲット画像を用いた複数の複雑なデータセットで、強力なロバスト性と一般化性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。