Skip to main content
QUICK REVIEW

[論文レビュー] Correlated Random Measures

Rajesh Ranganath, David M. Blei|arXiv (Cornell University)|Jul 2, 2015
Bayesian Methods and Mixture Models参考文献 56被引用数 5
ひとこと要約

本稿では、完全にランダムな測度を拡張する新しい構成である相関付きランダム測度を導入する。この手法は、原子重みの間にガウス過程によって誘導される依存関係を組み込むことで、ベイジアン非パラメトリックモデルにおける潜在的成分の相関を柔軟にモデル化可能となる。従来のモデルが仮定する独立性とは異なり、文書、ウェブクリック、電子的健康記録データの予測性能が向上し、医療状態の共起など意味のある依存関係を捉えることが可能になる。

ABSTRACT

We develop correlated random measures, random measures where the atom weights can exhibit a flexible pattern of dependence, and use them to develop powerful hierarchical Bayesian nonparametric models. Hierarchical Bayesian nonparametric models are usually built from completely random measures, a Poisson-process-based construction in which the atom weights are independent. Completely random measures imply strong independence assumptions in the corresponding hierarchical model, and these assumptions are often misplaced in real-world settings. Correlated random measures address this limitation. They model correlation within the measure by using a Gaussian process in concert with the Poisson process. With correlated random measures, for example, we can develop a latent feature model for which we can infer both the properties of the latent features and their dependency pattern. We develop several other examples as well. We study a correlated random measure model of pairwise count data. We derive an efficient variational inference algorithm and show improved predictive performance on large datasets of documents, web clicks, and electronic health records. Supplementary materials for this article are available online.

研究の動機と目的

  • 階層的ベイジアン非パラメトリックモデルにおける成分重みの独立性仮定の制限に対処すること。これは、現実のデータにおける依存関係を正しく表現できない場合が多い。
  • 成分重みの間で柔軟かつ構造的な相関をもつランダム測度を構築するための汎用フレームワークを構築すること。
  • 文書、ウェブクリック、電子的健康記録などの複雑で高次元のデータのモデルにおいて、より優れた予測性能とより豊かな解釈可能性を実現すること。
  • ポisson因子分解やベータ・ベルヌーイ過程といった既存の非パラメトリックモデルを、ガウス過程を用いた潜在的相関を組み込むことで拡張すること。
  • 大規模データ環境におけるスケーラブルな事後分布近似のための効率的な変分推論アルゴリズムを提供すること。

提案手法

  • 潜在空間上の位置をインデックスとする原子の重みに依存関係を導入するため、ポアソン過程と、潜在的位置を原子重みにマップするガウス過程を組み合わせることで、相関付きランダム測度を構築する。
  • 潜在的カーネル関数を用いて、成分重み間の共分散構造を定義し、正の相関、負の相関、あるいは複雑な相関を柔軟にモデル化可能とする。
  • ランダム測度を、ガウス過程から抽出された重み(非負性を保証するためリンク関数(例:ソフトプラス)を経由して変換)を用いた、潜在空間上の位置でインデックス付けられた原子の重ね合わせとして定義する。
  • 変分推論アルゴリズムを導出し、平均場近似と確率的最適化を用いてスケーラビリティを確保することで、相関付き非パラメトリックポアソン因子分解(CNPF)を実現する。
  • 尤度関数と事前分布の構造を変更することで、このフレームワークを、相関付きベータ過程や相関付きバイナリ潜在特徴モデルなど複数のモデルに適応する。
  • DILNモデルを、相関付きランダム測度の正規化版として定義し、階層的ディリクレ過程を拡張して成分重みの依存性を許容する。

実験結果

リサーチクエスチョン

  • RQ1ベイジアン非パラメトリックモデルにおいて、共起する医療診断や頻繁に同時にクリックされる研究論文といった、意味のある潜在的成分間の相関をモデル化できるか?
  • RQ2適切なランダム測度の理論的性質を保ちつつ、原子重みに依存関係をもたせるランダム測度をどのように構築できるか?
  • RQ3成分重みの間の相関を組み込むことで、テキスト、ウェブクリック、EHRs といった実世界のデータにおける予測性能が向上するか?
  • RQ4大規模データセットにスケーラブルに適用可能な、相関付きランダム測度のための効率的な推論アルゴリズムを開発できるか?
  • RQ5標準的な完全にランダムな測度と比較して、相関付きランダム測度は、解釈可能で医学的に意味のあるパターンをデータから捉えるのに優れているか?

主な発見

  • ArXivデータセットにおける未観測クリックの予測において、相関付き非パラメトリックポアソン因子分解(CNPF)モデルは、従来の非相関モデルを上回る予測精度を示した。
  • メイオクリニックの電子的健康記録データでは、2型糖尿病と虚血性心不全、および肥満と2型糖尿病の間の医学的に意味のある成分相関が同定された。
  • ソフトプラスリンク関数を用いた標準的なCNPFモデルが、すべてのデータセットでソフトプラス変種を上回る性能を示し、より良いフィットと一般化性能を示した。
  • モデルは、うつ病、心不全、がんに関連する診断のクラスタなど、解釈可能な潜在的成分を高い事後信頼度で同定した。
  • 変分法を用いた推論により、数千人のユーザーとアイテムを含む大規模データに適用可能なスケーラブルな推論が可能となった。
  • このフレームワークは、相関付きベータ過程やバイナリ潜在特徴モデルなど、複数のモデルに一般化可能であり、ポアソン因子分解を超えた広範な適用可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。