Skip to main content
QUICK REVIEW

[論文レビュー] Negative Binomial Construction of Random Discrete Distributions on the Infinite Simplex

Yuguang Ipsen, Ross Maller|arXiv (Cornell University)|Feb 7, 2018
Bayesian Methods and Mixture Models参考文献 14被引用数 8
ひとこと要約

本稿は、パrameter $r>0$ と Lévy 密度 $\rho$ を持つ負の二項点過程を用いて、Poisson 点過程を置き換えることで、無限単体上の新しいランダム離散分布のクラス $\mathbf{PK}^{(r)}(\rho)$ を導入する。主な貢献は、$\theta>0$ に対して二パラメータ Poisson-Dirichlet 分布 $\mathbf{PD}(\alpha,\theta)$ を含む一般化であり、トリムド安定劣化子フレームワークを拡張し、正規化されたジャンプのスティック・ブレイキング表現と極限定理を提供することにある。

ABSTRACT

The Poisson-Kingman distributions, $\mathrm{PK}(ρ)$, on the infinite simplex, can be constructed from a Poisson point process having intensity density $ρ$ or by taking the ranked jumps up till a specified time of a subordinator with Lévy density $ρ$, as proportions of the subordinator. As a natural extension, we replace the Poisson point process with a negative binomial point process having parameter $r>0$ and Lévy density $ρ$, thereby defining a new class $\mathrm{PK}^{(r)}(ρ)$ of distributions on the infinite simplex. The new class contains the two-parameter generalisation $\mathrm{PD}(α, θ)$ of Pitman and Yor (1997) when $θ>0$. It also contains a class of distributions derived from the trimmed stable subordinator. We derive properties of the new distributions, with particular reference to the two most well-known $\mathrm{PK}$ distributions: the Poisson-Dirichlet distribution $\mathrm{PK}(ρ_θ)$ generated by a Gamma process with Lévy density $ρ_θ(x) = θe^{-x}/x$, $x>0$, $θ> 0$, and the random discrete distribution, $\mathrm{PD}(α,0)$, derived from an $α$-stable subordinator.

研究の動機と目的

  • 無限単体上のランダム離散分布の Poisson-Kingman フレームワークを、Poisson 点過程の代わりに負の二項点過程を用いることで拡張すること。
  • 既存の分布(例:$\mathbf{PD}(\alpha,\theta)$ および $\mathbf{PD}_{\alpha}^{(r)}$)を一般化する追加パラメータ $r>0$ を導入することで、データの過分散に対処すること。
  • 新しいクラス $\mathbf{PK}^{(r)}(\rho)$ の正規化されたジャンプのスティック・ブレイキング表現と極限定理を導出することにより、重い尾部または外れ値に敏感な構造を示す現実世界のデータのモデリングを改善すること。
  • 最大尤度推定器が一貫性を欠くことが知られている $\theta$ の推定を改善するため、柔軟な $r$-パラメータ拡張を導入すること。

提案手法

  • パラメータ $r>0$ と Lévy 密度 $\rho$ を持つ負の二項点過程を用いて、古典的な Poisson-Kingman の構成における標準的な Poisson プロセスの代わりに、新しいクラス $\mathbf{PK}^{(r)}(\rho)$ を構築する。
  • 正規化されたジャンプサイズ $\mathbf{V}^{(r)} = (V_1^{(r)}, V_2^{(r)}, \ldots)$ を、点過程の順序付きジャンプをその合計で割ったものとして定義し、無限単体上での分布を形成する。
  • 連続するジャンプの比から得られる Beta 分布に従う確率変数の系列と関連付けることで、$\mathbf{PK}^{(r)}(\rho)$ のスティック・ブレイキング表現を確立する。
  • Lévy プロセスの指数関数的関数に基づく測度変換技術を用いて、元の $\mathbf{V}$ と関数 $\mathfrak{E}_1 = \Lambda(\Delta_1, \infty)$ を用いて、正規化されたベクトル $\mathbf{V}^{(r)}$ の分布を導出する。
  • 極限 $\lim_{n\to\infty} n V_n^{(r)\alpha} / V_1^{(r)\alpha}$ がほとんど確実かつ $p$ 階モーメントで $\mathfrak{E}_1 / V_1^{(r)\alpha}$ に収束することを証明し、尾部の挙動を Lévy 測度と関連付ける。
  • クラス $\mathbf{PK}^{(r)}(\rho)$ が $\theta>0$ に対して二パラメータ Poisson-Dirichlet 分布 $\mathbf{PD}(\alpha,\theta)$ を含み、かつトリムド安定劣化子分布 $\mathbf{PD}_{\alpha}^{(r)}$ を含むことを示し、既知の結果を拡張する。

実験結果

リサーチクエスチョン

  • RQ1Poisson-Kingman の構成を、負の二項点過程を用いることで、過分散データを扱えるように一般化するにはどうすればよいか?
  • RQ2新しいクラス $\mathbf{PK}^{(r)}(\rho)$ の正規化されたジャンプのスティック・ブレイキング表現は何か? また、元の Poisson-Kingman フレームワークとはどのように関係するか?
  • RQ3正規化されたジャンプの尾部確率の極限挙動は何か? そして、Lévy 測度の観点からどのように特徴づけられるか?
  • RQ4$\mathbf{PK}^{(r)}(\rho)$ の新しいクラスは、二パラメータ Poisson-Dirichlet 分布 $\mathbf{PD}(\alpha,\theta)$ およびトリムド安定劣化子分布 $\mathbf{PD}_{\alpha}^{(r)}$ とどのように関係するか?
  • RQ5追加パラメータ $r>0$ は、$\theta$ の推定、特に $\theta$ の最大尤度推定器が一貫性を欠くことが知られている状況において、改善をもたらすか?

主な発見

  • 負の二項点過程による構成により、無限単体上のランダム離散分布の新しいクラス $\mathbf{PK}^{(r)}(\rho)$ が得られ、古典的な Poisson-Kingman フレームワークが一般化される。
  • クラス $\mathbf{PK}^{(r)}(\rho)$ は $\theta>0$ に対して二パラメータ Poisson-Dirichlet 分布 $\mathbf{PD}(\alpha,\theta)$ を含み、その適用範囲が拡張される。
  • スティック・ブレイキング表現が $\mathbf{PK}^{(r)}(\rho)$ に対して導出され、正規化されたジャンプが i.i.d. の Beta 分布に従う変数の積として表現される。これは、$\mathbf{PD}(\alpha,\theta)$ に対する標準的なスティック・ブレイキングを一般化する。
  • 極限 $\lim_{n\to\infty} n V_n^{\alpha} / V_1^{\alpha}$ がほとんど確実かつ $p$ 階モーメントで $\mathfrak{E}_1 / V_1^{\alpha}$ に収束し、$\mathfrak{E}_1 = \Lambda(\Delta_1, \infty)$ である。これは尾部の特徴づけを提供する。
  • $\mathbf{PK}^{(r)}(\rho)$ のクラスは、トリムド安定劣化子分布 $\mathbf{PD}_{\alpha}^{(r)}$ を含み、負の二項点過程と安定劣化子の間の関係を確立する。
  • このフレームワークは、Poisson-Kingman モデルの柔軟な代替手段を提供し、特に語彙頻度や資本配分分布など、外れ値や過分散を示すデータのモデリングに特に有益である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。