Skip to main content
QUICK REVIEW

[論文レビュー] Tempering by Subsampling

Jan-Willem van de Meent, Brooks Paige|arXiv (Cornell University)|Jan 28, 2014
Markov Chains and Monte Carlo Methods参考文献 27被引用数 6
ひとこと要約

本稿では、データを再帰的に無作為に抽出することで、計算コストを低減する、ベイesianモデルにおけるマルコフ連鎖モンテカルロ(MCMC)サンプリングの計算効率の高い手法、すなわちサブサンプリングによる温度調整を提案する。この手法は、全データを用いた評価を避けることで、計算コストを削減し、ベースラインのサンプラーと比較して、単位計算あたりの有効サンプルサイズを向上させる。特に、サブサンプルされた温度付き遷移(STT)は、高次元の正規分布およびガウス過程モデルにおいて、他の手法を上回る性能を示す。

ABSTRACT

In this paper we demonstrate that tempering Markov chain Monte Carlo samplers for Bayesian models by recursively subsampling observations without replacement can improve the performance of baseline samplers in terms of effective sample size per computation. We present two tempering by subsampling algorithms, subsampled parallel tempering and subsampled tempered transitions. We provide an asymptotic analysis of the computational cost of tempering by subsampling, verify that tempering by subsampling costs less than traditional tempering, and demonstrate both algorithms on Bayesian approaches to learning the mean of a high dimensional multivariate Normal and estimating Gaussian process hyperparameters.

研究の動機と目的

  • ベイズ推論における温度付きMCMC手法の計算コストを低減しつつ、サンプリング効率を維持または向上させること。
  • 従来の温度調整手法は、全尤度評価を伴うため、データセットサイズに比例して計算負荷が増大するが、その高い計算負担を軽減すること。
  • データサブサンプリングを温度調整の一種として用いる2つの新しいアルゴリズム—サブサンプル並列温度調整(SPT)とサブサンプル温度付き遷移(STT)—の開発および分析を行うこと。
  • サブサンプリングによる温度調整が、ベースラインのサンプラーと比較して、単位計算あたりの有効サンプルサイズをより高めるという実験的妥当性を検証すること。
  • 本手法の計算効率および収束特性について、理論的・実験的根拠を提供すること。

提案手法

  • 観測値を再帰的に無作為に抽出(復元抽出なし)することで、人工的な温度に似た状態を生成し、データに加熱・冷却のプロセスを模倣する。
  • サブサンプル並列温度調整(SPT)は、複数のチェインを異なるサブサンプルデータセットで維持し、チェイン間のスワップ提案を通じて混合性を向上させる。
  • サブサンプル温度付き遷移(STT)は、決定論的な温度ラダーを用い、サブサンプルデータを前向きおよび後向きに走査し、メトロポリス・ハスティングス比による受理を実施する。
  • 中心的なアイデアは、尤度計算コストを小さなデータサブセットを用いることで低減させることであり、これにより単一サンプルあたりのコストを下げる一方で、複雑な後方分布の探索能力を維持できることである。
  • 本手法は、一般のMCMCサンプラー(例:HMC、MH、ギブス)をラップする外側のループとして実装され、尤度が観測可能なデータセット上で条件付きに定義されていることのみを要件とする。
  • 漸近的実行時間解析により、サブサンプリングが、特にデータセットサイズが大きくなると、全データ温度調整に比べて計算コストを低減することが確認された。

実験結果

リサーチクエスチョン

  • RQ1温度調整中にデータをサブサンプリングすることで、計算コストを低減しつつ、ベイズMCMCにおけるサンプリング効率を維持または向上させることができるか?
  • RQ2サブサンプリングによる温度調整は、ベースラインのサンプラーと比較して、単位計算あたりの有効サンプルサイズをより高めるか?
  • RQ3データセットサイズおよびパrameter次元数の変化に伴い、サブサンプル温度調整の性能はどのように変化するか?
  • RQ4サブサンプルを再サンプリングすることで、ベイズ因子の不偏推定量を取得するためにサブサンプル温度調整を用いることができるか?
  • RQ5特に有効サンプルサイズの観点から、異なる内部サンプラー(例:HMC 対 MH)の収束行動はどのように比較されるか?

主な発見

  • サブサンプル温度付き遷移(STT)は、すべてのテスト対象モデルおよびパラメータ次元数において、一貫して最も高い有効サンプル数/秒を達成した。
  • 50次元の多変量正規分布モデルでは、STTはMHを内部サンプラーとして用い、0.0579の有効サンプル数/秒を達成し、他のすべての手法を上回った。
  • 100次元の正規分布モデルにHMCを適用した場合、STTは0.0145の有効サンプル数/秒を達成し、次に優れた手法と比べて顕著な差を示した。
  • ガウス過程のハイパーパrameter推定モデルでは、STTはすべてのデータセットサイズおよび次元数において、他のすべての手法を上回り、モデルの複雑さに対して高いロバストネスを示した。
  • データセットサイズが増加するに従い、サブサンプル温度調整とベースライン手法との性能差が拡大した。これは、本手法のスケーラビリティを裏付けるものである。
  • 高次元設定においても、ベースラインサンプラーが混合性が悪く、有効サンプル数が低い問題に直面する中で、本手法は優れた性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。