Skip to main content
QUICK REVIEW

[論文レビュー] An Acceleration Framework for High Resolution Image Synthesis

Jinlin Liu, Yuan Yao|arXiv (Cornell University)|Sep 9, 2019
Generative Adversarial Networks and Image Synthesis参考文献 19被引用数 5
ひとこと要約

本論文では、高解像度画像合成の高速化を図るために、画像を小さな潜在コードに圧縮するエンコーダ・デコーダを訓練し、生成器がフル解像度画像の代わりにこれらのコンact表現から学習できる二段階のGANフレームワークを提案する。この手法により、トレーニング時間を最大80%短縮でき、FIDスコアも向上し、1台のNVIDIA P100 GPUで1024×1024画像生成をわずか3日間で実現した。

ABSTRACT

Synthesis of high resolution images using Generative Adversarial Networks (GANs) is challenging, which usually requires numbers of high-end graphic cards with large memory and long time of training. In this paper, we propose a two-stage framework to accelerate the training process of synthesizing high resolution images. High resolution images are first transformed to small codes via the trained encoder and decoder networks. The code in latent space is times smaller than the original high resolution images. Then, we train a code generation network to learn the distribution of the latent codes. In this way, the generator only learns to generate small latent codes instead of large images. Finally, we decode the generated latent codes to image space via the decoder networks so as to output the synthesized high resolution images. Experimental results show that the proposed method accelerates the training process significantly and increases the quality of the generated samples. The proposed acceleration framework makes it possible to generate high resolution images using less training time with limited hardware resource. After using the proposed acceleration method, it takes only 3 days to train a 1024 *1024 image generator on Celeba-HQ dataset using just one NVIDIA P100 graphic card.

研究の動機と目的

  • 高解像度画像(例:1024×1024)のトレーニングに要する高い計算コストと長時間のトレーニングを解消すること。
  • サンプル品質を損なわずに、高解像度画像生成に必要なメモリとハードウェア要件を低減すること。
  • 大きな画像の代わりに小さな潜在コードの分布を学習することで、トレーニングの安定性を向上させること。
  • 画像圧縮と生成を分離することで、限られたハードウェア(例:1台のハイエンドGPU)でも効率的なトレーニングを可能にすること。

提案手法

  • 高解像度画像をコンactな潜在コード(例:1024×1024画像の場合にh/4 × w/4 × 16)にマップする完全畳み込み型エンコーダ・デコーダネットワークを訓練する。
  • 低解像度画像上で事前トレーニングした後、エンコーダおよびデコーダのパラメータを固定し、各データセットに対して再トレーニングを回避する。
  • ランダムノイズから潜在コードを生成する別個の生成器ネットワークを訓練し、圧縮表現の分布を学習する。
  • 事前トレーニング済みのデコーダネットワークを用いて、生成された潜在コードを高解像度画像に復元する。
  • 標準GANと同一の識別器および損失関数を用いるが、入力を生ピixeではなく潜在コードに適用する。
  • 実画像から導出された潜在コード上でコード生成器をトレーニングすることで、安定的かつ効率的な最適化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1生成器や識別器のアーキテクチャを変更せずに、高解像度GANのトレーニング効率を著しく向上させることができるか?
  • RQ2フル画像の代わりに圧縮された潜在コードを生成することで、トレーニングの安定性と収束速度が向上するか?
  • RQ3限られたハードウェアリソースを用いて、提案フレームワークがトレーニング時間をどの程度短縮し、FIDスコアを改善できるか?
  • RQ4事前トレーニング済みのエンコーダ・デコーダは、微調整なしに異なるデータセット間で転送可能であり、多様な画像分布で性能を維持できるか?

主な発見

  • CelebA-HQデータセットを用いた1024×1024 GAN生成器のトレーニングは、本手法を用いることで1台のNVIDIA P100 GPUでわずか3日間で実現した。これは従来手法の14–41日を大幅に下回る。
  • 1024×1024画像生成のFIDスコアは、ベースラインの54.83から加速後は14.80に低下し、顕著な品質向上を示した。
  • 512×512画像の場合、FIDは30.43から14.72に低下し、解像度にかかわらず一貫した性能向上が確認された。
  • 1エポックあたりのトレーニング時間は、ベースラインの225分からh/4×w/4×16コードサイズでは45分に短縮され、4倍の高速化が達成された。
  • より小さなコードサイズ(例:h/16×w/16×16)でもFIDは低く(22.12)維持され、1エポックあたりのトレーニング時間は9分にまで短縮された。
  • LSUNデータセット(ベッドルーム:FID 38.32 → 17.90、チャurch:FID 30.99 → 21.91)に対しても、本フレームワークは一般化可能であり、加速によりFIDが著しく改善された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。