Skip to main content
QUICK REVIEW

[論文レビュー] Information-Theoretic Scoring Rules to Learn Additive Bayesian Network Applied to Epidemiology

Gilles Kratzer, Reinhard Furrer|arXiv (Cornell University)|Aug 3, 2018
Bayesian Modeling and Causal Inference参考文献 20被引用数 5
ひとこと要約

この論文は、疫学分野の混合分布データから加法的ベイジアンネットワーク(ABN)を学習するための、頻度主義的情報理論的スコアルール(AIC、BIC、MDLなど)を実装したRパッケージabnを紹介する。構造学習において、特に小標本サイズ下でも優れた性能を示し、分離問題に対処するための特化した推定アルゴリズム(特に効率的なRcpp最適化Iリスティング実装を含む)を採用している。

ABSTRACT

Bayesian network modelling is a well adapted approach to study messy and highly correlated datasets which are very common in, e.g., systems epidemiology. A popular approach to learn a Bayesian network from an observational datasets is to identify the maximum a posteriori network in a search-and-score approach. Many scores have been proposed both Bayesian or frequentist based. In an applied perspective, a suitable approach would allow multiple distributions for the data and is robust enough to run autonomously. A promising framework to compute scores are generalized linear models. Indeed, there exists fast algorithms for estimation and many tailored solutions to common epidemiological issues. The purpose of this paper is to present an R package abn that has an implementation of multiple frequentist scores and some realistic simulations that show its usability and performance. It includes features to deal efficiently with data separation and adjustment which are very common in systems epidemiology.

研究の動機と目的

  • システム疫学で一般的な混合分布データから、スケーラブルで自動化されたフレームワークを用いて加法的ベイジアンネットワーク(ABN)を学習するためのフレームワークを開発すること。
  • 複数の指数型分布族をサポートしない既存のRパッケージの限界と、二項回帰におけるデータ分離問題を解消すること。
  • 特に一般化線形モデル向けに、推定アルゴリズムを実装・ベンチマーク化し、計算性能と数値安定性を向上させること。
  • さまざまな情報理論的スコア(AIC、BIC、MDL、MLE、ベイジアン周辺尤度)が、異なる標本サイズとネットワーク密度下で真のネットワーク構造をどれだけ回復できるかを評価すること。

提案手法

  • abnパッケージは、混合変数タイプ(正規分布、二項分布、ポisson分布)を扱う一般化線形モデル(GLM)フレームワーク内に、頻度主義的スコアルール(AIC、BIC、MDL)とベイジアン周辺尤度スコアを実装している。
  • 特に二項モデルにおける分離問題に対処するにあたり、GLMパrameterの高速かつ安定な推定を実現するため、Rcpp最適化Iリスティング(IRLS)アルゴリズムの実装を採用している。
  • ネットワーク構造学習は、分解可能スコアに基づくスコア探索によって実施され、総スコアはノードごとの親ノードにのみ依存する加法的構造を持つ。
  • データ分離および準分離は、ロバスト推定技術とスパースデータの適切な処理により軽減され、有益な予測変数を任意に除外する必要がなくなる。
  • シミュレーションにより、JAGSを用いて密度と変数分布を制御したDAGを生成し、ノード順序に従って観測値を生成することでサイクルの維持を確保している。
  • 性能評価は、異なる標本サイズとネットワーク構造下での真陽性率、偽陽性率、偽陰性率を用い、パラメータ推定の正確性は最大ルート平均二乗誤差(max RMSE)で評価している。

実験結果

リサーチクエスチョン

  • RQ1異なる情報理論的スコア(AIC、BIC、MDL、MLE、ベイジアン周辺尤度)は、異なる標本サイズとネットワーク密度下で真のABN構造をどれだけ回復できるか?
  • RQ2標本サイズが小さい場合に、ベイジアン周辺尤度スコアが頻度主義的スコアを上回る程度はどの程度か?
  • RQ3Rcpp最適化Iリスティングアルゴリズムは、ABN学習における二項回帰の計算効率と数値安定性をどの程度向上できるか?
  • RQ4データ分離はパラメータ推定と構造学習にどのような影響を及ぼし、GLMベースのABNフレームワーク内でどのように軽減できるか?
  • RQ5ガウス分布、二項分布、ポアソン分布の混合変数タイプは、ABN学習におけるスコア性能とモデル選択の正確性にどのような影響を及ぼすか?

主な発見

  • Rcpp最適化Iリスティング実装(glm.irls_cpp)は、テストされたすべての推定アルゴリズムの中で最も高速であり、標準Rおよびspeedglm実装を著しく上回った。
  • ベイジアン周辺尤度スコア(abn)は、特に小標本サイズ下で構造学習において最も効率的で、エッジの欠如を効果的に特定した。
  • 最尤推定(mlik)は不適切であり、モデルの複雑さペナルティが欠落しているため、常に完全に接続されたネットワークを生成した。
  • AICは、BICやMDLと比較して、特に小標本領域で変動性が高く、性能が劣っていたことから、本文脈におけるモデル選択には信頼性が低いことが示された。
  • ベイジアン推定とMLE推定は、異なるネットワーク密度と標本サイズ下で非常に類似したmax RMSE値を示し、GLMフレームワークのロバスト性を裏付けた。
  • abnパッケージは、混合分布データとデータ分離問題を効果的に処理でき、数値的安定性を維持し、有益な予測変数を除外する必要がなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。