Skip to main content
QUICK REVIEW

[論文レビュー] A Structured Variational Auto-encoder for Learning Deep Hierarchies of Sparse Features

Tim Salimans|arXiv (Cornell University)|Feb 28, 2016
Generative Adversarial Networks and Image Synthesis参考文献 4被引用数 7
ひとこと要約

本論文は、層間の依存関係を反映した構造的事後分布と、修正ガウス分布による微分可能スパarsityを活用することで、階層的でスパースな潜在変数を持つ深層生成モデルを、層別事前学習を用いずに一括学習可能とする構造的変分オートエノード型モデルを提案する。修正ガウス分布を用いることで、スパースなスパike-and-slab型のスパarsityを実現するとともに、バックプロパゲーションによる勾配伝播を可能にした。この手法により、バイナリ化MNISTデータセットにおいて、テスト時の変分下界が-92.5 natsに達し、深くスパースな潜在階層における有効な学習が実現された。

ABSTRACT

In this note we present a generative model of natural images consisting of a deep hierarchy of layers of latent random variables, each of which follows a new type of distribution that we call rectified Gaussian. These rectified Gaussian units allow spike-and-slab type sparsity, while retaining the differentiability necessary for efficient stochastic gradient variational inference. To learn the parameters of the new model, we approximate the posterior of the latent variables with a variational auto-encoder. Rather than making the usual mean-field assumption however, the encoder parameterizes a new type of structured variational approximation that retains the prior dependencies of the generative model. Using this structured posterior approximation, we are able to perform joint training of deep models with many layers of latent random variables, without having to resort to stacking or other layerwise training procedures.

研究の動機と目的

  • スパイクアンドスラブ型のスパarsityを示す階層的潜在変数を有する深層生成モデルを構築し、効率的な学習を可能にするための微分可能性を維持すること。
  • 多くの層を持つ確率的潜在変数を有する深層モデルを、スタック型または層別事前学習プロトコルに依存せずに学習する課題に対処すること。
  • 生成モデルの事前分布の依存構造を保つ構造的変分事後分布近似を設計し、事後分布近似の精度を向上させること。
  • 確率的勾配変分推論とバックプロパゲーションを用いて、全階層にわたる勾配伝播を可能にする、エンドツーエンドの深層階層モデルの学習を可能にすること。

提案手法

  • 微分可能スパarsityを誘導する事前分布として、ガウス分布とゼロの最大値として定義される修正ガウス分布を提案。これにより、スパarsityと勾配伝播の両立が可能となる。
  • 各層のパラメータが、前層からの学習可能な重みとバイアスを用いて再帰的に計算される深層階層的生成モデルを構築。トップ層の平均は学習可能なパラメータとして扱う。
  • 生成モデルの条件付き依存関係を模倣する構造的変分事後分布を用い、各潜在変数の近似事後分布も修正ガウス分布としてモデル化する。
  • 各層における事後分布と事前分布のKLダイバージェンスの解析的表現を導出し、変分下界の正確な計算を可能にする。
  • バッチ正規化を各層に適用することで安定性を高め、不偏で微分可能な変分下界の近似を用いて、確率的勾配降下法による一括学習を実行する。
  • 下位から上位への推論ネットワークを用いて、変分事後分布の近似尤度パラメータを計算し、KLダイバージェンスの計算に使用する。

実験結果

リサーチクエスチョン

  • RQ1スパイクアンドスラブ型スパarsityを有する深層階層的生成モデルを、層別事前学習を用いずに確率的勾配変分推論によりエンドツーエンドで学習可能か?
  • RQ2深層潜在変数モデルにおいて、効率的な事後分布推論を維持しつつ、どのようにして微分可能スパarsityを実現できるか?
  • RQ3生成モデルの事前分布の階層的依存構造を保つ構造的変分事後分布近似は、深層モデルにおける事後分布近似の精度向上と学習安定性の向上に寄与するか?
  • RQ4複数層の確率的潜在変数を有するモデルは、MNISTなどのベンチマークデータセットにおいて、単一層VAEよりも尤度性能に優れるか?

主な発見

  • 4層の階層構造(それぞれ50, 100, 200, 300ユニット)を用いた際、バイナリ化MNISTデータセットでテスト時の変分下界が-92.5 natsに達した。
  • 修正ガウスユニットの使用により、スパイクアンドスラブ型のスパarsityを効果的に実現するとともに、全階層にわたるバックプロパゲーションが可能となった。
  • 構造的変分事後分布近似は、生成モデルの依存構造を的確に再現し、スタック型または層別事前学習を用いずに深層モデルの一括学習を可能にした。
  • 各層にバッチ正規化を適用することで、特に150例程度の小規模ミニバッチでも学習の安定性と収束速度が顕著に向上した。
  • モデルの深さと表現力が向上したにもかかわらず、性能は複数の決定的層を有する単一層VAEと同等にとどまり、この設定ではより深い確率的階層が顕著な性能向上をもたらしていないことが示された。
  • 本手法は、Adamaxなどの既存の深層学習最適化手法と互換性があり、標準的な深層学習パイプラインを用いて、確率的ユニットを有する深層階層モデルを効果的に学習可能であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。