Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Learning of Bounded-Treewidth Bayesian Networks from Complete and Incomplete Data Sets

Mauro Scanagatta, Giorgio Corani|arXiv (Cornell University)|Feb 7, 2018
Bayesian Modeling and Causal Inference参考文献 21被引用数 3
ひとこと要約

本稿では、完全および不完全データから有界木幅 Bayesian network を学習するための anytime アルゴリズム k-MAX を提案する。従来手法に比べ構造スコアとスケーラビリティの両面で顕著に優れており、構造的 EM に統合することで、最新のランダムフォレスト手法に比べ約 10 倍高速かつ同等の精度で線形時間でデータ補完が可能であり、完全に並列化可能である。

ABSTRACT

Learning a Bayesian networks with bounded treewidth is important for reducing the complexity of the inferences. We present a novel anytime algorithm (k-MAX) method for this task, which scales up to thousands of variables. Through extensive experiments we show that it consistently yields higher-scoring structures than its competitors on complete data sets. We then consider the problem of structure learning from incomplete data sets. This can be addressed by structural EM, which however is computationally very demanding. We thus adopt the novel k-MAX algorithm in the maximization step of structural EM, obtaining an efficient computation of the expected sufficient statistics. We test the resulting structural EM method on the task of imputing missing data, comparing it against the state-of-the-art approach based on random forests. Our approach achieves the same imputation accuracy of the competitors, but in about one tenth of the time. Furthermore we show that it has worst-case complexity linear in the input size, and that it is easily parallelizable.

研究の動機と目的

  • 大規模データから有界木幅 Bayesian network を学習するためのスケーラブルで高パフォーマンスなアルゴリズムの開発。
  • 不完全データからの構造学習の計算ボトル neck を、k-MAX を構造的 EM に統合することで解決。
  • 高い精度と低い計算コストを維持しながら、有界木幅ネットワークを用いた効率的なデータ補完を可能にすること。
  • 大規模応用に適した線形最悪ケース時間計算量とネイティブな並列化を達成すること。

提案手法

  • k-MAX は木幅制約下で構造を反復的に最適化する高度なヒューリスティクスを用い、高スコアな DAG を保証する。
  • アルゴリズムは anytime であり、途中で停止しても現在の最良解が得られ、数千変数へのスケーラビリティを考慮して設計されている。
  • k-MAX は構造的 EM (SEM) の最大化ステップに統合され、有界木幅推論を用いて期待十分統計の効率的計算が可能になる。
  • 学習済みの有界木幅ネットワーク上で正確な推論を実行することでデータ補完を実現し、木幅と変数の濃度が定数のとき、各クエリのコストは O(n) となる。
  • パイプライン全体が並列化可能であり、親集合の特定、k-MAX 最適化、期待値フェーズのクエリがコア間で分散可能である。
  • 実行時間制限(例:t=1,5,10)によるパrameterチューニングにより、ユーザーが精度と実行時間のバランスを調整可能である。

実験結果

リサーチクエスチョン

  • RQ1k-MAX は完全データ上で k-greedy や他の anytime アルゴリズムに比べ、有界木幅 Bayesian network の高スコア構造を一貫して達成できるか?
  • RQ2k-MAX は不完全データ向けに構造的 EM に効率的に統合可能であり、数千変数規模にスケーリング可能か?
  • RQ3得られる SEM-k-MAX 法は、最先端のアプローチと比較して、顕著に短い実行時間で競争力のある補完精度を達成できるか?
  • RQ4SEM-k-MAX の理論的時間計算量は何か?入力サイズに対して線形にスケーリングするか?
  • RQ5SEM-k-MAX パイプラインは複数プロセッサ間でどの程度並列化可能か?

主な発見

  • k-MAX は、特に高次元設定において、k-greedy や他の競合手法に比べ、完全データセット上で一貫してより高いスコアの Bayesian network 構造を達成する。
  • SEM-k-MAX は、最先端のランダムフォレストベース手法と同等のデータ補完精度を達成するが、実行速度は約 10 倍高速である。
  • SEM-k-MAX の最悪ケース時間計算量は入力サイズに線形(O(nd))であり、数千変数を含む大規模データセットへのスケーラビリティを有する。
  • 本手法はネイティブに並列化可能であり、変数、コア、データポイントごとに独立して実行可能であり、効率的な分散展開が可能である。
  • 実行時間制限(例:t=1,5,10)によるパrameterチューニングにより、ユーザーが精度と速度のバランスを調整可能であり、実験では t=1 が最も良いトレードオフを示した。
  • 本手法は、大規模スケールで効率的な SEM と有界木幅学習を組み合わせた最初の研究であり、不完全データにおける tractable 推論を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。