Skip to main content
QUICK REVIEW

[論文レビュー] Learning the Stein Discrepancy for Training and Evaluating Energy-Based Models without Sampling

Will Grathwohl, Kuan-Chieh Wang|arXiv (Cornell University)|Feb 13, 2020
Generative Adversarial Networks and Image Synthesis参考文献 53被引用数 15
ひとこと要約

この論文では、サンプリングを伴わずにエネルギー分布モデルの学習と評価が可能な、学習可能なステイン不一致(LSD)を提案する。この手法は、データ分布とモデル分布の間のステイン不一致を推定するためのニューラルネットワークのクリティックを学習することで、未正規化された対数密度の勾配のみを用い、高次元設定において、モデル評価と学習スケーラビリティの分野で最先端の性能を達成する。

ABSTRACT

We present a new method for evaluating and training unnormalized density models. Our approach only requires access to the gradient of the unnormalized model's log-density. We estimate the Stein discrepancy between the data density $p(x)$ and the model density $q(x)$ defined by a vector function of the data. We parameterize this function with a neural network and fit its parameters to maximize the discrepancy. This yields a novel goodness-of-fit test which outperforms existing methods on high dimensional data. Furthermore, optimizing $q(x)$ to minimize this discrepancy produces a novel method for training unnormalized models which scales more gracefully than existing methods. The ability to both learn and compare models is a unique feature of the proposed method.

研究の動機と目的

  • エネルギー分布モデル(EBM)のような未正規化密度モデルの信頼性が高くスケーラブルな評価法・学習法の欠如に取り組む。これらは高価なMCMCサンプリングに依存している。
  • 既存のサンプリングに基づく学習(例:有限なMCMCチェインからのバイアスのある勾配)および評価(例:近似サンプラーに依存する)の制限を克服する。
  • 未正規化対数密度の勾配のみを用いて、EBMの学習と評価を統合するフレームワークを構築する。
  • サンプルに基づく指標を、尤度をより正確に追跡するニューラルネットワークで推定されたステイン不一致に置き換えることで、モデル品質の評価を向上させる。
  • 正規化定数やスコアマッチングのような代替目的を必要とせず、スケーラブルな高次元でのEBMの学習を可能にする。

提案手法

  • データ分布 $ p(x) $ とモデル $ q(x) $ 間のステイン不一致を、ベクトル値関数としてのクリティック関数 $ s(x) $ を用いて定義する。この関数はニューラルネットワークとしてパラメータ化される。
  • ステイン不一致を最大化するようにクリティックネットワークを学習させ、バックプロパゲーションを介して微分可能かつスケーラブルな適合度テストを形成する。
  • 得られた不一致をEBMの学習目的として用い、サンプリングを伴わず、モデル密度をデータに一致させるために最小化する。
  • ステイン不一致におけるヤコビ行列のトレースを効率的に計算するためにハッチンソン推定法を活用し、スケーラブルな勾配計算を可能にする。
  • GANに類似した交互最適化の枠組みを採用し、EBMとクリティックを交互に最適化する共同学習スキームを適用するが、密度モデリングを目的とする。
  • 正規化定数や明示的なサンプリングを必要とせず、未正規化対数密度の勾配へのみアクセスを要件とする。

実験結果

リサーチクエスチョン

  • RQ1高次元のデータ分布とモデル分布の間のステイン不一致を、サンプリングに依存せずに効果的に推定できるニューラルネットワークを訓練できるか?
  • RQ2ニューラルネットワークで学習されたクリティック関数は、従来のサンプルベースの指標と比較して、未正規化モデルの適合度テストにおいてより信頼性が高くスケーラブルであるか?
  • RQ3学習されたステイン不一致を最小化することは、エネルギー分布モデルの尤度ベースの学習に対する効果的でスケーラブルな代替手段となり得るか?
  • RQ4LSDに基づく学習目的は、コントラスト・ダイバージェンスやスコアマッチングといった標準的な目的と比較して、実際の尤度の向上をどれほど正確に追跡できるか?
  • RQ5伝統的なMCMCベースの手法がスケーリングに失敗する高次元設定において、LSDはモデルの評価と学習をどれほど向上させ得るか?

主な発見

  • LSDは、ベンチマークデータセット上で、高次元の適合度テストにおいて最先端の性能を達成し、既存手法を上回る。
  • LSDに基づく学習目的は、コントラスト・ダイバージェンスやスコアマッチングといった標準的手段よりも、尤度をより正確に追跡する。特に高次元設定において顕著である。
  • この手法は、サンプリングを伴わず、次元数の増加に伴い滑らかにスケーリングするエネルギー分布モデルの学習を可能にする。
  • ニューラルネットワークベースのクリティックは、高次元においてステイン不一致を信頼性高く推定できるよう学習し、ディープラーニングが複雑な不一致測度を効果的に近似できることを示している。
  • LSDは、未正規化モデルの学習と評価を統合するフレームワークを提供し、別個のサンプラーまたはヒューリスティック指標の必要性を排除する。
  • 画像データセットにおける実験では、LSDで学習されたモデルが、標準的な目的で学習されたモデルと比較して、競争力のあるサンプル品質を維持するとともに、より優れた分布の忠実性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。