Skip to main content
QUICK REVIEW

[論文レビュー] Cooperative Training of Fast Thinking Initializer and Slow Thinking Solver for Conditional Learning

Jianwen Xie, Zilong Zheng|arXiv (Cornell University)|Feb 7, 2019
Generative Adversarial Networks and Image Synthesis参考文献 77被引用数 5
ひとこと要約

本論文では、条件付き生成タスクにおける高速思考型イニシャライザと低速思考型ソルバを共同で学習する協調学習フレームワーク、CCoopNetsを提案する。イニシャライザはノイズに依存する直接的で初期の出力を提供し、ソルバは学習されたエネルギー関数に基づく反復的最適化によってそれを改善する。2つのモデルは、改善知識をイニシャライザに蒸留することで相互に進化し、画像対画像変換および画像補完タスクで最先端の性能を達成する。

ABSTRACT

This paper studies the problem of learning the conditional distribution of a high-dimensional output given an input, where the output and input may belong to two different domains, e.g., the output is a photo image and the input is a sketch image. We solve this problem by cooperative training of a fast thinking initializer and slow thinking solver. The initializer generates the output directly by a non-linear transformation of the input as well as a noise vector that accounts for latent variability in the output. The slow thinking solver learns an objective function in the form of a conditional energy function, so that the output can be generated by optimizing the objective function, or more rigorously by sampling from the conditional energy-based model. We propose to learn the two models jointly, where the fast thinking initializer serves to initialize the sampling of the slow thinking solver, and the solver refines the initial output by an iterative algorithm. The solver learns from the difference between the refined output and the observed output, while the initializer learns from how the solver refines its initial output. We demonstrate the effectiveness of the proposed method on various conditional learning tasks, e.g., class-to-image generation, image-to-image translation, and image recovery. The advantage of our method over GAN-based methods is that our method is equipped with a slow thinking process that refines the solution guided by a learned objective function.

研究の動機と目的

  • スケッチから画像への変換やクラスから画像への生成など、入力と出力が異なるドメインに属する高次元の条件付き分布を学習する課題に対処すること。
  • 生成された出力の品質と多様性を向上させるために、学習された目的関数に従って制御される反復的で構造的な改善プロセスを導入することで、GANベースの手法の限界を克服すること。
  • 高速イニシャライザと低速ソルバが相互に知識蒸留によって向上するように、共同学習の枠組みを構築すること。
  • 直接的なマッピングと反復的最適化を組み合わせることで、条件付き学習タスクにおけるロバストで高品質な生成を実現すること。
  • ニューラルネットワークイニシャライザとラングヴィンダイナミクスに基づくソルバを活用して、画像補完の性能を向上させること。

提案手法

  • 高速思考型イニシャライザは、条件とノイズベクトルを直接入力として受け取り、アノセストサンプリングにより迅速な生成を可能にするニューラルネットワークを用いる。
  • 低速思考型ソルバは、学習されたエネルギー関数によって定義される条件付きエネルギーに基づくモデルであり、ラングヴィンダイナミクスによるサンプリングによって反復的改善を実行する。
  • ソルバはエネルギー関数を最小化することでイニシャライザの出力を改善し、確率的勾配ステップを用いて効果的に最適化を実行する。
  • イニシャライザは、初期出力とソルバの改善出力の差を教師信号として用いて、ソルバの改善出力を予測するように学習する。
  • ソルバは、改善出力を目的関数の適応のターゲットとして用い、エネルギー関数の最小値を観測された正例データに近づけるように学習する。
  • 共同学習は、「改善(初期出力を精錬)」と「学習(両モデルの勾配降下による更新)」を交互に実行することで行われる。

実験結果

リサーチクエスチョン

  • RQ1高速思考と低速思考を統合した協調学習フレームワークは、エンドツーエンドのGANや変分オートエンコーダーを凌駕する条件付き生成性能を達成できるか?
  • RQ2学習されたエネルギー関数に従って制御される反復的最適化プロセスを組み込むことで、生成出力の品質と多様性はどの程度向上するか?
  • RQ3低速思考型ソルバは、高速思考型イニシャライザの出力をどの程度改善し、正例データと整合性の高い出力に近づけるか?
  • RQ4イニシャライザとソルバの間での相互知識蒸留は、画像対画像変換および補完タスクにおける一般化性能とロバスト性を向上させるか?
  • RQ5定量的指標と定性的なサンプル品質の両面で、協調フレームワークは、既存の敵対的および変分的手法を上回る性能を示すか?

主な発見

  • CMPファサードデータセットでは、CCoopNetsはPSNR 20.47、SSIM 0.77を達成し、cVAE-GAN(19.43、0.68)、cVAE-GAN++(19.14、0.64)、BicycleGAN(19.07、0.64)、pix2pix(19.34、0.74)を上回った。
  • パリ・ストリートビュー・データセットでは、CCoopNetsはPSNR 21.17、SSIM 0.79を達成し、pix2pix(15.17、0.75)を含むすべてのベースラインを上回った。
  • ソルバの単体でもイニシャライザより高い品質の出力を得ており、ラングヴィンダイナミクスによる反復的改善の有効性が裏付けられた。
  • CCoopNetsのモデル複雑度(55.84Mパラメータ)は、cVAE-GAN++(64.30M)とBicycleGAN(64.30M)を下回りながら、競争力のある推論時間(22.43秒/エポック)を維持した。
  • 図16の定性的な結果から、ソルバの出力は、特に閉塞領域における複雑な構造的詳細の回復において、ベースラインよりも正例に忠実であることが示された。
  • 共同学習プロセスにより、イニシャライザはソルバの反復的改善プロセスから得た知識を吸収し、より優れた初期化戦略を学習でき、全体の生成品質が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。