Skip to main content
QUICK REVIEW

[論文レビュー] DeepI2I: Enabling Deep Hierarchical Image-to-Image Translation by Transferring from GANs

Yaxing Wang, Lu Yu|arXiv (Cornell University)|Nov 11, 2020
Generative Adversarial Networks and Image Synthesis参考文献 77被引用数 8
ひとこと要約

DeepI2I は、浅い層からの構造的特徴と深い層からの意味的特徴を活用することで、形状の大きな変化を伴うクラス間の画像対画像翻訳を向上させる、深層階層的画像対画像翻訳フレームワークを提案する。事前学習済みの BigGAN や StyleGAN モデルからの知識の転送と、重みの不整合を解消するアダプターネットワークの使用により、ベンチマークデータセット上で mFID を 35% 減少させ、100 以上のクラスにわたる高品質でスケーラブルな翻訳を実現する。

ABSTRACT

Image-to-image translation has recently achieved remarkable results. But despite current success, it suffers from inferior performance when translations between classes require large shape changes. We attribute this to the high-resolution bottlenecks which are used by current state-of-the-art image-to-image methods. Therefore, in this work, we propose a novel deep hierarchical Image-to-Image Translation method, called DeepI2I. We learn a model by leveraging hierarchical features: (a) structural information contained in the shallow layers and (b) semantic information extracted from the deep layers. To enable the training of deep I2I models on small datasets, we propose a novel transfer learning method, that transfers knowledge from pre-trained GANs. Specifically, we leverage the discriminator of a pre-trained GANs (i.e. BigGAN or StyleGAN) to initialize both the encoder and the discriminator and the pre-trained generator to initialize the generator of our model. Applying knowledge transfer leads to an alignment problem between the encoder and generator. We introduce an adaptor network to address this. On many-class image-to-image translation on three datasets (Animal faces, Birds, and Foods) we decrease mFID by at least 35% when compared to the state-of-the-art. Furthermore, we qualitatively and quantitatively demonstrate that transfer learning significantly improves the performance of I2I systems, especially for small datasets. Finally, we are the first to perform I2I translations for domains with over 100 classes.

研究の動機と目的

  • 高解像度のボトル neck に起因する、現在の I2I メソッドが形状の大きな変化を伴うクラス間の翻訳に限界を示す問題に対処すること。
  • 従来のモデルが約 40 クラスに制限されるのとは異なり、スケーラブルで多数のクラスをカバーする画像対画像翻訳を可能にすること。
  • 事前学習済みの GAN からの知識転送を用いて、小規模データセットでも訓練の安定性と性能を向上させること。
  • 事前学習済み GAN の部品から I2I モデルを初期化する際に生じる重みの不整合問題を解消すること。
  • 多様なドメインにわたり、高解像度で現実的かつ高品質な出力を得られる、深層 I2I 翻訳の実現可能性を示すこと。

提案手法

  • モデルは階層的エンコーダ・デコーダアーキテクチャを採用し、複数のネットワーク深さからの特徴を統合することで、構造的および意味的情報を捉える。
  • I2I モデルのエンコーダーとディスクラミネーターは、BigGAN や StyleGAN の事前学習済みディスクラミネーター重みを用いて初期化される。
  • ジェネレーターは、同じ GAN からの事前学習済みジェネレーター重みを用いて初期化され、学習済みの画像生成能力が転送される。
  • アダプターネットワークを導入して、事前初期化されたエンコーダーとジェネレーター間の特徴分布を一致させ、不整合を軽減する。
  • 潜在的クラス埋め込みを用いることで、100 以上のクラスにわたるスケーラブルな単一モデルによる翻訳を可能にする。
  • 事前学習済み GAN からの知識転送により、収束が早まり、特に小規模データセットでも性能が向上する。

実験結果

リサーチクエスチョン

  • RQ1形状の大きな変化を伴うクラス間の翻訳品質を、深層階層的 I2I フレームワークが向上させられるか?
  • RQ2事前学習済み GAN からの知識転送が、I2I モデルの初期化に効果的であり、小規模データセットでも性能を向上させられるか?
  • RQ3提案されたアダプターネットワークは、事前初期化されたエンコーダーとジェネレーター部品間の不整合をどのように解消するか?
  • RQ4従来の I2I システムが約 40 クラスに制限されるのに対し、本手法は単一モデルで 100 クラス以上にスケーリング可能か?
  • RQ5階層的特徴統合と GAN を用いた転移学習の組み合わせが、生成画像の現実性と多様性を優れたものにできるか?

主な発見

  • DeepI2I は、Animal Faces、Birds、Foods データセットにおいて、最先端の手法と比較して mFID を最低でも 35% 減少させた。
  • 本モデルは、100 以上のクラスにわたる多数クラス I2I 翻訳を実現し、従来の単一モデル手法では達成できなかった能力を示した。
  • ユーザースタディーの結果、StarGAN や DMIT と比較して、DeepI2I は著しく現実的な画像を生成しており、78% のペairワイズ比較でその出力が好まれた。
  • 事前学習済み GAN からの知識転送戦略により、収束が早まり、特に小規模データセットでも性能が向上した。
  • アダプターネットワークは、エンコーダーとジェネレーター間の不整合を効果的に解消し、評価されたすべてのデータセットで一貫して翻訳品質を向上させた。
  • 未学習の I2I 翻訳、例えば人間の顔を動物の顔に変換するようなタスクでも、高品質で現実的な結果が得られ、優れた一般化能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。