Skip to main content
QUICK REVIEW

[論文レビュー] Nearly Consistent Finite Particle Estimates in Streaming Importance Sampling

Alec Koppel, Amrit Singh Bedi|arXiv (Cornell University)|Sep 23, 2019
Sparse and Compressive Sensing Techniques参考文献 58被引用数 4
ひとこと要約

本稿では、再帰的カーネルヒルバート空間(RKHS)における最大平均差分(MMD)を用いた低次元部分空間への事後密度推定の投影によって、ほぼ一貫した有限粒子推定を維持するストリーミング重要度サンプリング手法を提案する。この手法は、圧縮パラメータを介してバイアスを調整可能にすることで、メモリ使用量を大幅に削減しながら、完全なサンプル法と同等の推定精度を維持する。

ABSTRACT

In Bayesian inference, we seek to compute information about random variables such as moments or quantiles on the basis of {available data} and prior information. When the distribution of random variables is {intractable}, Monte Carlo (MC) sampling is usually required. {Importance sampling is a standard MC tool that approximates this unavailable distribution with a set of weighted samples.} This procedure is asymptotically consistent as the number of MC samples (particles) go to infinity. However, retaining infinitely many particles is intractable. Thus, we propose a way to only keep a \\emph{finite representative subset} of particles and their augmented importance weights that is \\emph{nearly consistent}. To do so in {an online manner}, we (1) embed the posterior density estimate in a reproducing kernel Hilbert space (RKHS) through its kernel mean embedding; and (2) sequentially project this RKHS element onto a lower-dimensional subspace in RKHS using the maximum mean discrepancy, an integral probability metric. Theoretically, we establish that this scheme results in a bias determined by a compression parameter, which yields a tunable tradeoff between consistency and memory. In experiments, we observe the compressed estimates achieve comparable performance to the dense ones with substantial reductions in representational complexity.

研究の動機と目的

  • 無限の粒子が必要とされる一貫性を達成するが、有限のメモリ制約により粒子保持が制限されるモンテカルロ法におけるスケーラビリティの課題に対処する。
  • 有限で代表的な粒子のサブセットを維持するオンライン・ストリーミングアルゴリズムを構築し、事後分布を近似する。
  • 圧縮パラメータによる制御が可能なバイアスを保証することで、メモリ使用量と推定精度の間でトレードオフを調整可能にする理論的一致性を確保する。
  • 直接測度空間への投影が困難であることを補うために、カーネル平均埋め込みを用いて事後分布をRKHSに埋め込む。
  • MMDに基づく直交一致追求(OMP)の停止基準を用いることで、オンライン設定においてモデルの次数が有限に増加することを実現する。

提案手法

  • カーネル平均埋め込みを用いて、事後密度推定値を再帰的カーネルヒルバート空間(RKHS)に埋め込むことで、確率測度に対する線形代数的操作を可能にする。
  • 最大平均差分(MMD)——積分確率距離——を用いて、事後分布のRKHS表現を低次元部分空間に逐次投影する。
  • MMDに基づく直交一致追求(OMP)アルゴリズムを適用し、現在の部分空間から十分に離れている粒子を逐次選択することで、多様性と代表性を確保する。
  • MMD距離に基づく停止基準を用いる:新しい粒子の特徴写像が現在の部分空間からの距離が閾値 ε/g(x(n)) 未満であれば、粒子は追加されない。
  • 投影誤差を重要度重みとMMD距離の関数として定式化することで、圧縮によって生じるバイアスの理論的制御を可能にする。
  • 辞書に保持される粒子数が有限であり、$ Oig((W/ u)^{2p}ig) $ で上界が与えられることを確立する。ここで $ W $ は非正規化重要度重みの上限、$ u $ は圧縮閾値である。

実験結果

リサーチクエスチョン

  • RQ1有限個の粒子のみを用いても、重要度サンプリングにおける漸近的一致性を維持できるか?
  • RQ2オンライン・ストリーミング環境下で、圧縮された粒子集合が真の事後分布を適切に代表していることをどのように保証できるか?
  • RQ3有限粒子圧縮によって生じる理論的バイアスは何か? その量を特定・制御可能か?
  • RQ4MMDに基づく投影基準は、非正規化重要度重みが有界である条件下で、辞書サイズの有限なモデル次数の増加を保証できるか?
  • RQ5ストリーミングベイズ推論において、推定精度を損なわずに、どれほどメモリ複雑性を削減できるか?

主な発見

  • 提案手法は、圧縮パラメータ ε によって明示的にバウンドされるバイアスを有するほぼ一貫した推定を達成し、メモリ使用量と精度の間で調整可能なトレードオフを実現する。
  • 辞書に保持される粒子数は有限であり、$ Cig((W/ u)ig)^{2p} $ で上界が与えられる。ここで $ W $ は非正規化重要度重みの上限、$ u $ はMMD閾値である。
  • MMD-OMPの停止基準により、現在の部分空間からの距離が顕著に大きい場合にのみ新しい粒子が追加されるため、重複または冗長な粒子の蓄積を防ぐ。
  • 理論的解析により、モデル次数の増加(すなわち辞書サイズの増加)は、MMD距離が $ rac{ u}{g(oldsymbol{x}(n))} $ を超える場合にのみ発生することが示され、有界な重要度重みの下でこれはゼロから離れていることが保証される。
  • 実験的結果により、圧縮された推定値が完全なサンプル法と同等の性能を達成することが示され、表現の複雑さが顕著に低減されている。
  • この手法により、投影誤差が $ u $ でバウンドされ、$ u \to 0 $ の極限で真の事後分布に収束することが保証され、圧縮が限りなく小さくなる際の一貫性が確立される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。