Skip to main content
QUICK REVIEW

[論文レビュー] Exponential Series Approaches for Nonparametric Graphical Models

Eric Janofsky|arXiv (Cornell University)|Jun 11, 2015
Statistical Methods and Inference参考文献 69被引用数 6
ひとこと要約

本稿では、正則化最大尤度法とスコアマッチングを用いて、非パラメトリックグラフィカルモデルの指数級数的手法を提案し、高次元密度推定におけるスパarsityとリスク一致性を実現する。弱い滑らかさ仮定の下で、パラメータ推定およびモデル選択の一貫性に関する理論的保証を確立し、合成データおよび実世界のMEGデータを用いた実証的検証を実施する。

ABSTRACT

This thesis studies high-dimensional, continuous-valued pairwise Markov Random Fields. We are particularly interested in approximating pairwise densities whose logarithm belongs to a Sobolev space. For this problem we propose the method of exponential series [Crain, 1974; Barron and Sheu, 1991], which approximates the log density by a finite- dimensional exponential family with the number of sufficient statistics increasing with the sample size. We consider two approaches to estimating these models. The first is regularized maximum likelihood. This involves optimizing the sum of the log-likelihood of the data and a sparsity-inducing regularizer. We provide consistency and edge selection guarantees for this method. We then propose a variational approximation to the likelihood based on tree- reweighted, nonparametric message passing. We then consider estimation using regularized score matching. This approach uses an alternative scoring rule to the log-likelihood, which obviates the need to compute the normalizing constant of the distribution. For general continuous-valued exponential families, we provide parameter and edge consistency results. We then describe results for model selection in the nonparametric pairwise model using exponential series. The regularized score matching problem is shown to be a convex program; we provide scalable algorithms based on consensus Alternating Direction Method of Multipliers (ADMM, [Boyd et al., 2011]) and Coordinate-wise Descent. We compare our method to others in the literature as well as the aforementioned TRW estimator using simulated data.

研究の動機と目的

  • 高次元データにおけるペアワイズ依存構造をモデル化することで、非パラメトリック密度推定における次元の呪いに対処すること。
  • 結合密度にパラメトリック仮定を置かない非有向グラフィカルモデルの推定のための理論的裏付けのある手法を開発すること。
  • 正則化と関数的近似を用いて、高次元設定下でのスパarsityおよびモデル選択の一貫性を確保すること。
  • 真の密度に弱い滑らかさ条件が成り立つ場合に、リスク一貫性およびパラメータ推定の保証を提供すること。
  • 機能的メッセージパッシングやコンSENSUS ADMMといった新規アルゴリズムを用いて、実用的な推定を可能にすること。

提案手法

  • ヒルバート空間における指数級数展開を用いて、非パラメトリックなペアワイズ密度を近似し、正規直交基底関数(例:レジェンドル多項式)を活用する。
  • ℓ1型ペナルティを用いた正則化最大尤度推定を適用し、推定されたグラフィカルモデルにおけるスパarsityを誘導する。
  • 尤度の扱いやすさを向上させるために、木構造に基づく再重み付け変分尤度近似(TRW)を導入する。
  • 正則化尤度およびスコアマッチング目的関数の効率的最適化に、機能的メッセージパッシングおよびコンセンサスADMMを用いる。
  • プライマル・デュアル・ウィtness条件および集中不等式を用いて理論的バインディングを導出し、パラメータおよびモデル選択の一貫性を確立する。
  • 正規化定数を回避できるハイヴァリネン型スコアルールを用いたスコアマッチングを採用し、指数型分布族でない設定でも推定を可能にする。

実験結果

リサーチクエスチョン

  • RQ1弱い滑らかさ仮定の下で、指数級数近似は非パラメトリックグラフィカルモデルにおいてリスク一貫性およびモデル選択の一貫性を達成できるか?
  • RQ2関数的係数へのℓ1ペナルティによる正則化は、高次元ペアワイズ密度推定におけるスパarsityおよび推定精度にどのように影響するか?
  • RQ3非パラメトリック設定下で、一貫性のあるパラメータおよびグラフ構造回復に必要な理論的サンプル複雑度はどの程度か?
  • RQ4機能的メッセージパッシングおよびコンセンサスADMMは、標準的手法(例:glasso)と比較して、計算効率およびエッジ選択精度においてどのように異なるか?
  • RQ5非パラメトリック基底展開を用いたスコアマッチングは、正則化MLEを上回り、複雑な非ガウス型依存構造の推定において優れた性能を示せるか?

主な発見

  • 提案手法である正則化MLEに指数級数近似を組み合わせた手法は、弱い滑らかさ条件の下で、$ O\big(\frac{\text{polylog}(d)}{n}\big) $ のレートでリスク一貫性を達成する。
  • 調整パrameter $ \rho_n $ が $ \frac{\rho_n}{\rho^*} \to 0 $ を満たす場合、正しいエッジの含む・含まないの選択が保証される。
  • 非パラメトリックなペアワイズモデルにおいて、真の密度が次数 $ r $ のソボレフ空間に属する場合、推定誤差レートは $ \tilde{O}(n^{-\frac{2r-1}{2r+13}}) $ を達成する。
  • 実験的結果では、TRWに基づくSKEPTIC推定量が、合成ガウス分布およびコプールデータにおいて、glassoやTRWを上回るエッジ選択性能を示し、特に高次元設定で顕著である。
  • MEGデータでは、提案手法が生物学的に妥当な脳結合パターンを回復し、glassoやTRWと比較してエッジ選択性能が向上している。
  • コンセンサスADMMに基づくQUASRアルゴリズムの正則化パスは、さまざまなサンプルサイズにおいて安定した収束と正確なグラフ回復を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。