Skip to main content
QUICK REVIEW

[論文レビュー] Fast and scalable non-parametric Bayesian inference for Poisson point processes

Shota Gugushvili, Frank van der Meulen|arXiv (Cornell University)|Apr 10, 2018
Statistical Methods and Bayesian Inference被引用数 4
ひとこと要約

本稿では、[0,T] 上の非定常ポアソン点過程の強度関数を推定するための、高速でスケーラブルな非パラメトリックベイズ手法を2つ提案する。1つ目の手法は、N個のビンに分割された区間における区分定数強度関数に独立したガンマ事前分布を用い、閉形式の後部分布をもたらす。2つ目の手法は、ガンママルコフ連鎖事前分布を用い、ギブスサンプリングによるMCMC推論を可能にする。主な貢献は、h-ホルダー連続な強度関数に対して理論的に最適な後部収縮率を達成することであり、2番目の手法はビン数Nの選択に対してより優れたロバストネスを示す。

ABSTRACT

We study the problem of non-parametric Bayesian estimation of the intensity function of a Poisson point process. The observations are $n$ independent realisations of a Poisson point process on the interval $[0,T]$. We propose two related approaches. In both approaches we model the intensity function as piecewise constant on $N$ bins forming a partition of the interval $[0,T]$. In the first approach the coefficients of the intensity function are assigned independent gamma priors, leading to a closed form posterior distribution. On the theoretical side, we prove that as $n ightarrow\infty,$ the posterior asymptotically concentrates around the "true", data-generating intensity function at an optimal rate for $h$-Hölder regular intensity functions ($0 < h\leq 1$). In the second approach we employ a gamma Markov chain prior on the coefficients of the intensity function. The posterior distribution is no longer available in closed form, but inference can be performed using a straightforward version of the Gibbs sampler. Both approaches scale well with sample size, but the second is much less sensitive to the choice of $N$. Practical performance of our methods is first demonstrated via synthetic data examples. We compare our second method with other existing approaches on the UK coal mining disasters data. Furthermore, we apply it to the US mass shootings data and Donald Trump's Twitter data.

研究の動機と目的

  • ポアソン点過程の強度関数を推定するための高速でスケーラブルな非パラメトリックベイズ手法の開発。
  • h-ホルダー連続な強度関数に対して、後部集中率の理論的最適性の確保。
  • 従来の手法と比較して、ビン数Nの選択に対するロバストネスの向上。
  • 特に大規模データセットに対して実用的な推論を可能にする、効率的なMCMCアルゴリズムの実装。

提案手法

  • 区間[0,T]をN個のビンに分割し、強度関数を区分定数関数としてモデル化。係数に独立したガンマ事前分布を割り当てることで、閉形式の後部分布を計算可能にする。
  • 強度係数にガンママルコフ連鎖事前分布を用いることで滑らかさを誘導し、単純なギブスサンプラーによるMCMCサンプリングを可能にする。
  • 異なるビン数Nのモデルを探索するための可逆ジャンプMCMCアルゴリズムを導出。Nに対する事前分布と、局所的提案を用いたモデル移動のための手続きを含む。
  • ガンママルコフ連鎖モデルに対して、メトロポリス・イン・ギブスサンプラーを実装。平滑化パrameter α とビン係数の両方に事前分布を設定。
  • 可逆ジャンプMCMCにおけるモデル選択と収束の評価に、周辺尤度の近似とトレースプロットを用いる。
  • 両手法を合成データ、英国の石炭鉱山事故、米国の銃乱射事件、ドナルド・トランプのTwitterデータに適用し、実用的性能を示す。

実験結果

リサーチクエスチョン

  • RQ1ポアソン点過程強度関数に対して、高速でスケーラブルな非パラメトリックベイズ推論を達成できるか?
  • RQ2区分定数強度係数に独立したガンマ事前分布を用いることで、閉形式の後部分布が得られ、最適な後部収縮率が達成されるか?
  • RQ3ガンママルコフ連鎖事前分布は、独立したガンマ事前分布と比較して、ビン数Nの選択に対するロバストネスを向上させられるか?
  • RQ4本手法は、不連続性や振動を示すような複雑な強度パターンを示す実世界データセットに対し、どのように性能を発揮するか?
  • RQ5Nに対する異なる事前分布を用いた可逆ジャンプMCMCにおいて、周辺尤度と後部モデルインデックス分布の挙動はいかなるものか?

主な発見

  • 独立したガンマ事前分布を用いた手法は、閉形式の後部分布をもたらし、高速な計算と、h-ホルダー連続な強度関数に対して理論的に最適な後部収縮率の達成を可能にする。
  • ガンママルコフ連鎖事前分布を用いた手法は、閉形式の後部分布をもたらさないが、ギブスサンプリングによる効率的な推論が可能であり、Nの選択に対して著しく感受性が低い。
  • 両手法の後部収縮率は、h-ホルダー連続な強度関数(0 < h ≤ 1)に対して最適なレートを達成しており、理論的最適性が確認された。
  • 合成例では、ガンママルコフ連鎖事前分布を用いた手法が、より滑らかな後部実現値を生成し、不連続性を含む複雑な強度パターンをよりよく捉えている。
  • 英国の石炭鉱山事故データでは、2番目の手法が従来の手法を上回り、境界領域や変動が激しい領域でも優れた性能を示した。
  • 数値実験の結果、独立したガンマ事前分布を用いた可逆ジャンプMCMCにおいて、周辺対数尤度に複数の局所的最大値が存在することが判明し、モデル空間の探索に課題があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。