Skip to main content
QUICK REVIEW

[論文レビュー] Generative networks as inverse problems with Scattering transforms

Tomás Angles, Stéphane Mallat|arXiv (Cornell University)|May 17, 2018
Generative Adversarial Networks and Image Synthesis参考文献 13被引用数 7
ひとこと要約

本論文は、事前に定義されたウェーブレット散乱変換埋め込みを逆転させることで、深層畳み込み生成ネットワークを逆問題として定式化する、新しい生成モデリングフレームワークを提案する。敵対的学習や学習済みエンコーダーの必要性を排除し、リプシッツ連続的でスケール分離された信号表現を通じて、GANに類似した画像生成品質と変形特性を達成する。定量的評価では、CelebA、Polygon5、LSUNのデータセットで競争力のある再構成性能と生成性能を示した。

ABSTRACT

Generative Adversarial Nets (GANs) and Variational Auto-Encoders (VAEs) provide impressive image generations from Gaussian white noise, but the underlying mathematics are not well understood. We compute deep convolutional network generators by inverting a fixed embedding operator. Therefore, they do not require to be optimized with a discriminator or an encoder. The embedding is Lipschitz continuous to deformations so that generators transform linear interpolations between input white noise vectors into deformations between output images. This embedding is computed with a wavelet Scattering transform. Numerical experiments demonstrate that the resulting Scattering generators have similar properties as GANs or VAEs, without learning a discriminative network or an encoder.

研究の動機と目的

  • 距離ベースの学習における次元の呪いにもかかわらず、GAN や VAE の一般化に関する数学的理解の欠如に取り組む。
  • 学習済みエンコーダーの必要性を排除するため、安定な埋め込み演算子を事前に定義することで、生成モデリングにおける敵対的学習の必要性をなくす。
  • 識別器やエンコーダーを学習させずに、GAN に類似した画像品質とモーフィング特性を達成できるかを実証する。
  • ウェーブレットに基づく散乱変換を用いた数学的根拠に基づいた逆問題フレームワークを、生成モデリングに提供する。

提案手法

  • 生成器は、固定された事前に定義された埋め込み演算子の逆として訓練され、特にリプシッツ連続的で変形に強いウェーブレット散乱変換が用いられる。
  • 埋め込み演算子は、翻訳を線形化し、局所的な l¹ 範囲のウェーブレット係数によってガウス化を実現するウェーブレット散乱変換を用いて計算される。
  • 生成器は、過学習を防ぐために、DCGAN と同じアーキテクチャを持つ深層畳み込みネットワークとして実装される。
  • 再構成と元の訓練画像間の L¹ 損失を最小化することで逆問題を解き、散乱係数を潜在的コードとして用いる。
  • 本手法は、ウェーブレット係数のスパarsity と、ネットワーク活性化のスパarsity(平均 70% がゼロ)を暗黙の正則化として活用する。
  • ハイパーパramータのチューニングを避け、散乱変換の固有の性質に依存することで、安定的で一般化可能な画像生成を実現する。

実験結果

リサーチクエスチョン

  • RQ1固定された埋め込み演算子の逆転によって、敵対的学習や学習済みエンコーダーなしに生成画像合成を達成できるか?
  • RQ2GAN で観察される変形やモーフィング行動を再現するために、埋め込み演算子に必要な性質は何か?
  • RQ3学習済みエンコーダーと比較して、埋め込み演算子として散乱変換を用いることで、再構成性能と一般化性能にどのような差が生じるか?
  • RQ4ウェーブレット係数のスパarsity とネットワーク活性化のスパarsity が、生成器の一般化能力にどの程度寄与しているか?
  • RQ5生成モデリングの逆問題定式化は、暗黙の生成モデルに代わるより解釈可能で数学的根拠のある代替手段を提供できるか?

主な発見

  • 散乱生成器は、CelebA テストセットで 21.17 dB、Polygon5 で 34.44 dB、LSUN(ベッドルーム)で 18.53 dB の PSNR 再構成誤差を達成し、優れた再構成忠実度を示した。
  • 散乱潜在空間における線形補間により、訓練画像とテスト画像の間で滑らかで連続的な画像変形が得られ、GAN に類似したモーフィング行動を再現した。
  • ネットワークは、Polygon5 や CelebA といった単純なデータセットでは高品質でシャープな画像を生成したが、LSUN ではメモリ容量の制限により高周波数成分が欠落していた。
  • ネットワークの活性化は平均で 70% のスパarsity を示しており、スパarsity が学習済み生成器における主要な正則化機構であると考えられる。
  • 訓練データを 256 サンプルに削減したところ、再構成で高周波数成分が回復した。これは、画像品質の劣化がアーキテクチャ的欠陥ではなく、メモリ制限に起因することを確認した。
  • ランダムなガウスノイズ入力に対しても、本手法は訓練データと強い視覚的類似性を持つ画像を生成でき、特に単純なデータセットでは優れた一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。