Skip to main content
QUICK REVIEW

[論文レビュー] Iterative Refinement of the Approximate Posterior for Directed Belief Networks

R Devon Hjelm, Kyunghyun Cho|arXiv (Cornell University)|Nov 19, 2015
Model Reduction and Neural Networks被引用数 8
ひとこと要約

本稿では、適応的最重要サンプリングを用いて認識ネットワークからの事後分布推定を繰り返し精錬する、反復的近似事後分布の精錬(IRVI)を提案する。この手法により、方向的信念ネットワークにおける変分推論が向上し、勾配の分散が低減され、有効サンプルサイズが増加し、より正確な対数尤度推定とより優れた生成的再構成が得られる。複雑な認識モデルを必要としない。

ABSTRACT

Variational methods that rely on a recognition network to approximate the posterior of directed graphical models offer better inference and learning than previous methods. Recent advances that exploit the capacity and flexibility in this approach have expanded what kinds of models can be trained. However, as a proposal for the posterior, the capacity of the recognition network is limited, which can constrain the representational power of the generative model and increase the variance of Monte Carlo estimates. To address these issues, we introduce an iterative refinement procedure for improving the approximate posterior of the recognition network and show that training with the refined posterior is competitive with state-of-the-art methods. The advantages of refinement are further evident in an increased effective sample size, which implies a lower variance of gradient estimates.

研究の動機と目的

  • 変分推論における固定容量の認識ネットワークの制限を解消すること。これにより、モデルの表現力が制限され、勾配の分散が増加する。
  • 初期認識ネットワーク出力以上の近似事後分布の精錬により、方向的グラフィカルモデルにおける対数尤度推定の精度を向上させること。
  • 反復的精錬が、特に初期事後分布が劣っている場合に、学習効率とテスト時推論品質の両方を向上させることを示すこと。
  • 精錬された事後分布が、単純化されたり低容量の認識ネットワークであっても、モデルの能力をより正確に評価可能にすることを示すこと。

提案手法

  • 本手法は、認識ネットワークを用いて変分事後分布を初期化し、その後、適応的最重要サンプリング(AIS)を用いて反復的精錬を実行することで、事後分布の近似を改善する。
  • 各精錬ステップでは、提案分布からサンプルを抽出し、それらを再重み付けして真の事後分布に近づける。
  • 精錬された事後分布を用いて、よりタイトな変分下界を計算する。この下界は漸近的に不偏であり、モンテカルロ勾配推定の分散を低減する。
  • 本手法は期待値最大化(EM)に類似した構造をとる:EステップではAISを用いて事後分布を精錬し、Mステップでは生成モデルおよび認識ネットワークのパラメータを最適化する。
  • 本手法は一般性を有し、離散的潜在変数を含む任意の方向的グラフィカルモデルに適用可能である。再パラメータライゼーションが不可能な場合にも適用可能である。
  • 精錬プロセスにより有効サンプルサイズが増加し、より正確で分散の小さい事後分布近似が得られる。

実験結果

リサーチクエスチョン

  • RQ1反復的精錬により、近似事後分布を精錬することで、方向的信念ネットワークにおける対数尤度推定の精度が向上するか?
  • RQ2事後分布の精錬は、学習中のモンテカルロ勾配推定の分散にどのように影響するか?
  • RQ3単純または低容量の認識ネットワークを反復的精錬でどれほど改善できるか。これにより、モデルの真の生成的能力が明らかにされるか?
  • RQ4初期認識ネットワークが劣っていても、精錬された事後分布が、より優れた再構成と推論品質をもたらすか?
  • RQ5再パラメータライゼーションが利用できない離散的潜在変数を含むモデルに対しても、本手法は効果的に適用可能か?

主な発見

  • 適応的最重要サンプリング(AIR)による反復的精錬により、事後分布近似の有効サンプルサイズが増加することで、勾配推定の分散が顕著に低減された。
  • 20個の確率的ユニットを有する1層のシグモイド信念ネットワークにおいて、100ステップの精錬を経て、対数尤度推定誤差は、精錬なしの-127.51から-127.48に改善され、正確な値-127.474に近づいた。
  • 精錬された事後分布からの再構成は、初期認識ネットワークからの再構成よりも一貫して高品質であり、MNISTサンプルでは明確な数字の識別が可能になった。
  • 元の認識ネットワークパラメータの20%しか使用しなくても、反復的精錬によりカリフォルニア工科大学101のシルエットから意味のある画像構造を回復できた。
  • 簡素な事後分布を用いた場合でも、推論品質が向上した。高品質な推論が、複雑な認識モデルを必要としないことを示した。
  • 精錬された事後分布により、初期認識ネットワークが真の事後分布を捉えられなかった場合でも、モデルの能力をより正確に評価可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。