Skip to main content
QUICK REVIEW

[論文レビュー] No MCMC for me: Amortized sampling for fast and stable training of energy-based models

Will Grathwohl, Jacob Kelly|arXiv (Cornell University)|Oct 8, 2020
Gaussian Processes and Bayesian Inference参考文献 53被引用数 7
ひとこと要約

この論文では、エネルギー関数モデル(EBM)の学習における遅く不安定なMCMCサンプリングを、エントロピー正則化を用いた高速で微分可能な生成ネットワークに置き換えるVera(Variational Entropy Regularized Approximate maximum likelihood)を提案する。MCMCサンプリングのアンモトアイゼーションとエントロピー正則化の変分近似を用いることで、VERAはEBMの高速かつ安定した学習を可能にし、最先端の尤度スコアを達成するとともに、表形式データにおける効果的な半教師あり学習を実現する。

ABSTRACT

Energy-Based Models (EBMs) present a flexible and appealing way to represent uncertainty. Despite recent advances, training EBMs on high-dimensional data remains a challenging problem as the state-of-the-art approaches are costly, unstable, and require considerable tuning and domain expertise to apply successfully. In this work, we present a simple method for training EBMs at scale which uses an entropy-regularized generator to amortize the MCMC sampling typically used in EBM training. We improve upon prior MCMC-based entropy regularization methods with a fast variational approximation. We demonstrate the effectiveness of our approach by using it to train tractable likelihood models. Next, we apply our estimator to the recently proposed Joint Energy Model (JEM), where we match the original performance with faster and stable training. This allows us to extend JEM models to semi-supervised classification on tabular data from a variety of continuous domains.

研究の動機と目的

  • 高次元データにおけるエネルギー関数モデル(EBM)の学習において、MCMCベースの手法の不安定さと高い計算コストを解消すること。
  • スコアマッチング、ノイズ対比推定、MCMCサンプリングの制限を回避する、スケーラブルで安定的かつ効率的なEBM学習手法の代替策を開発すること。
  • 補助モデルの必要性やアーキテクチャ選択の制限なしに、EBMの高尤度学習を可能にすること。
  • 特に表形式データにおける半教師あり学習を想定した、連合エネルギーモデル(JEM)の学習を安定化・高速化すること。
  • エントロピー正則化付きの生成モデルが、高品質な尤度推定と一般化性能を達成できることを示すこと。

提案手法

  • EBMの最大尤度学習を二段階最適化問題として再解釈し、MCMCサンプリングのアンモトアイゼーションを可能にする。
  • モデル分布からのサンプリングを学習する生成ネットワークを導入し、反復的なMCMCステップを1回の順伝播に置き換える。
  • エントロピー正則化を、高速な変分近似を用いて生成ネットワークに適用し、安定性と収束性を向上させる。
  • エネルギー関数モデルの損失とエントロピー正則化を組み合わせた微分可能な目的関数を用い、バックプロパゲーションによるエンドツーエンド学習を可能にする。
  • 生成ネットワークからのサンプルを用いて尤度目的関数を近似する確率的勾配推定器を採用し、直接的なMCMCサンプリングを回避する。
  • 生成ネットワークを真のモデル分布の変分近似とみなす。エントロピー正則化により、多様性とカバレッジが保証される。

実験結果

リサーチクエスチョン

  • RQ1MCMCサンプリングを、学習可能で微分可能な生成ネットワークに置き換えることで、EBM学習の速度と安定性を向上させられるか?
  • RQ2変分近似によるエントロピー正則化は、従来のMCMCベースの手法に比べてより優れた尤度推定を実現するか?
  • RQ3VERAは、従来の手法が失敗する高次元の表形式データにおいて、JEMを用いた効果的な半教師あり学習を可能にするか?
  • RQ4画像および表形式ベンチマークにおいて、SOTAのEBMおよびGANベースのモデルと比較して、VERAは尤度と精度の両面で優れた性能を示すか?
  • RQ5VERAにおける生成ネットワークベースのサンプリングは、高品質なサンプルを生成しつつ、正確な尤度推定を維持できるか?

主な発見

  • 最適設定下で、混合ガウス分布の学習においてVERAはMCMCベースの学習(PCD)よりも顕著に高い尤度を達成し、ムーナスデータセットで-2.58(VERA)vs. -3.82(PCD)を記録した。
  • MNISTでは、α=1のVERAがFIDスコア27.5を達成し、SNGAN(25.50)とNCSN(23.52)を上回り、ベースラインJEMをも上回った。
  • HEPMASS、CROP、HUMANといった表形式データにおける半教師あり学習では、ドメイン知識が限られる状況で、VERAで学習されたJEMモデルがバーチャルアドバーシャルトレーニング(VAT)を上回った。
  • VERAは、従来のMCMCベース手法が不安定さのため失敗した表形式データにおけるJEMの学習を安定化させ、成功裏に半教師あり分類を実現した。
  • CIFAR-10とCIFAR-100では、それぞれFIDスコア30.5および32.4を達成し、強力な無条件および条件付き生成性能を示した。
  • アブレーションスタディにより、エントロピー正則化(λ)と生成ネットワークの多様性(α)が性能に重要であることが確認され、α=100が最良のFIDおよびISスコアを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。