Skip to main content
QUICK REVIEW

[論文レビュー] Learning Energy-Based Models by Diffusion Recovery Likelihood

Ruiqi Gao, Yang Song|arXiv (Cornell University)|Dec 15, 2020
Advanced Neuroimaging Techniques and Applications参考文献 52被引用数 15
ひとこと要約

この論文は、段階的にノイズの強いデータバージョン上で条件付き尤度最大化により逐次的エネルギー関数モデル(EBM)を学習することで、エネルギー関数モデル(EBM)を訓練するための拡散回復尤度を提案する。標準的なMLEとは異なり、 tractable な条件付きサンプリングを介して、高価な周辺分布からのMCMCサンプリングを回避することで、効率的な訓練とサンプリングを可能にする。CIFAR-10において、FID 9.58、インセプションスコア8.30の最先端性能を達成し、長時間にわたるMCMCチェインが安定して現実的なサンプルを生成する。これにより、正確な密度推定が可能となる。

ABSTRACT

While energy-based models (EBMs) exhibit a number of desirable properties, training and sampling on high-dimensional datasets remains challenging. Inspired by recent progress on diffusion probabilistic models, we present a diffusion recovery likelihood method to tractably learn and sample from a sequence of EBMs trained on increasingly noisy versions of a dataset. Each EBM is trained with recovery likelihood, which maximizes the conditional probability of the data at a certain noise level given their noisy versions at a higher noise level. Optimizing recovery likelihood is more tractable than marginal likelihood, as sampling from the conditional distributions is much easier than sampling from the marginal distributions. After training, synthesized images can be generated by the sampling process that initializes from Gaussian white noise distribution and progressively samples the conditional distributions at decreasingly lower noise levels. Our method generates high fidelity samples on various image datasets. On unconditional CIFAR-10 our method achieves FID 9.58 and inception score 8.30, superior to the majority of GANs. Moreover, we demonstrate that unlike previous work on EBMs, our long-run MCMC samples from the conditional distributions do not diverge and still represent realistic images, allowing us to accurately estimate the normalized density of data even for high-dimensional datasets. Our implementation is available at https://github.com/ruiqigao/recovery_likelihood.

研究の動機と目的

  • 高次元データにおけるエネルギー関数モデル(EBM)の訓練という課題に取り組む。標準的な最尤推定(MLE)では、周辺分布からの高価なMCMCサンプリングを必要とする。
  • 従来のEBM手法における長時間MCMCチェインの不安定性を克服する。これは、収束しないまたは不正な定常分布に起因し、しばしば現実的でないサンプルを生成する。
  • 学習済みEBM下での正規化されたデータ密度の正確な推定を、条件付き分布からの長時間MCMCチェインを活用することで実現する。
  • 直接的な生データへの適用ではなく、段階的なノイズを加えたデータレベルでの回復尤度に基づくEBMの学習により、サンプル品質と訓練効率を向上させる。
  • 拡散回復尤度で訓練されたEBMにおいて、忠実な長時間MCMCサンプリングが達成可能であることを示し、信頼性の高い密度評価を可能にする。

提案手法

  • 本手法は、時間経過とともにガウスノイズを加える拡散プロセスによって生成された、段階的にノイズの強いデータバージョン上で、エネルギー関数モデル(EBM)の系列を訓練する。
  • 各EBMは回復尤度を用いて訓練され、より高いノイズレベルにおけるノイズ入りデータから、元の綺麗なデータの条件付き尤度を最大化する。これにより、周辺尤度と比較してサンプリングが tractable になる。
  • 生成のためのサンプリングは、ガウスノイズから開始され、徐々にノイズレベルを低下させる条件付きサンプリングを繰り返すことで、拡散プロセスを逆方向に再現する。
  • 長時間MCMCチェインを生成するために、適応的ステップサイズを用いたハミルトニアンモンテカルロ(HMC)を用い、高い受容率とサンプルの現実性を確保する。
  • 正規化された分布の対数パーティション関数を推定するために、アニールドインポートランスサンプリング(AIS)を用いる。これにより、正規化された密度推定が可能になる。
  • Bengioら(2013)が提唱した回復尤度の目的関数を拡散設定に適応させ、周辺分布への直接サンプリングを回避することで、効率的な訓練を実現する。

実験結果

リサーチクエスチョン

  • RQ1ノイズを加えたデータにおける回復尤度は、高価な周辺MCMCサンプリングを必要とせず、効率的かつ安定したEBMの訓練を可能にするか?
  • RQ2拡散ベースEBMの条件付き分布からの長時間MCMCチェインは、現実的であると保証されるか?これは、有効で安定したエネルギー関数ポテンシャルを示唆する。
  • RQ3長時間MCMCと重要度サンプリングを用いることで、学習済みEBM下での正規化されたデータ密度を正確に推定できるか?
  • RQ4明示的なエネルギー関数の勾配をスコア関数として用いた場合、拡散回復尤度は、ノイズ除去スコアマッチングと比較してどの程度の性能を示すか?
  • RQ51000ステップの拡散タイムステップを増やすことで、長時間MCMCサンプリングと密度推定の安定性および品質が向上するか?

主な発見

  • 本手法は、無条件CIFAR-10でFID 9.58、インセプションスコア8.30を達成し、大多数のGANベース手法や既存の明示的EBM学習手法を上回る性能を示した。
  • 100,000ステップにわたる長時間MCMCチェインで、FID 24.89を達成し、正規近似からのチェイン(FID 25.12)に非常に近い現実性を維持した。
  • 正規化されたデータ分布の対数パーティション関数の推定値は、複数回の実験で安定して収束し、アニールドインポートランスサンプリングによる信頼性の高い密度推定を示した。
  • 変数変換とAISを用いた正規化されたデータ密度の正確な推定が可能であり、表4にテストビット/次元として報告されたが、推定値は確率的下限界である。
  • 1,000ステップの拡散タイムステップでさえ、長時間MCMCチェインが忠実で現実的であることが確認され、学習済みエネルギー関数ポテンシャルが有効で構造的であることを示した。
  • 明示的エネルギー関数の勾配をスコア関数として用いた場合、本手法は単純なノイズ除去スコアマッチングを上回り、エネルギー関数全体を学習するEBMの優位性を強調した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。