[論文レビュー] MissDAG: Causal Discovery in the Presence of Missing Data with Continuous Additive Noise Models
MissDAG は、無視可能な欠損(ignorable missingness)と加法的ノイズモデル(ANMs)の下で、不完全なデータからの因果発見のための新しい期待最大化(EM)ベースのフレームワークである。この手法は、可視データの尤度を最大化することで、因果構造と欠損値の補完を同時に学習し、合成データおよび実世界の設定において、2段階の補完・発見アプローチを上回る性能を発揮する。
State-of-the-art causal discovery methods usually assume that the observational data is complete. However, the missing data problem is pervasive in many practical scenarios such as clinical trials, economics, and biology. One straightforward way to address the missing data problem is first to impute the data using off-the-shelf imputation methods and then apply existing causal discovery methods. However, such a two-step method may suffer from suboptimality, as the imputation algorithm may introduce bias for modeling the underlying data distribution. In this paper, we develop a general method, which we call MissDAG, to perform causal discovery from data with incomplete observations. Focusing mainly on the assumptions of ignorable missingness and the identifiable additive noise models (ANMs), MissDAG maximizes the expected likelihood of the visible part of observations under the expectation-maximization (EM) framework. In the E-step, in cases where computing the posterior distributions of parameters in closed-form is not feasible, Monte Carlo EM is leveraged to approximate the likelihood. In the M-step, MissDAG leverages the density transformation to model the noise distributions with simpler and specific formulations by virtue of the ANMs and uses a likelihood-based causal discovery algorithm with directed acyclic graph constraint. We demonstrate the flexibility of MissDAG for incorporating various causal discovery algorithms and its efficacy through extensive simulations and real data experiments.
研究の動機と目的
- 臨床試験や経済学などの実世界の応用においてしばしば成立しない完全なデータを前提としている既存の因果発見手法の限界に対処する。
- 補完後に発見を行う2段階的手法の非最適性(補完と構造学習の間で目的が不一致になることによるバイアス)を克服する。
- 無視可能な欠損と同定可能な ANMs の下で、因果発見と欠損データ処理を統合した包括的なフレームワークを開発する。
- 1つの柔軟な EM ベースの最適化フレームワーク内で、さまざまなスコアベースの因果発見アルゴリズムを活用できるようにする。
- 連続的加法的ノイズモデル(ANMs)の下で因果構造の同定可能性を保証する。これには線形非ガウス型、等分散を持つ線形ガウス型、非線形 ANMs が含まれる。
提案手法
- ANM仮定の下で、可視データの期待尤度を最大化するEMアルゴリズムとして、欠損データを伴う因果発見を定式化する。
- 欠損エントリの閉形式事後分布が計算不能な場合には、EステップでモンテカルロEM(MCEM)を用い、尤度の近似を可能にする。
- Mステップで密度変換技術を採用し、ANMs から導かれる単純かつ明確な形のノイズ分布をモデル化することで、取り扱いやすさを向上させる。
- DAG制約を課したスコアベースの因果発見アルゴリズムをEMフレームワークに統合し、柔軟かつ原理的根拠のある構造学習を可能にする。
- 連続的最適化(例:NOTEARS風の制約)を用いてDAG制約を課し、学習されたグラフが無閉路のまま保たれるようにする。
- マークホフ等価クラスを扱えるように、同定可能なANMs(例:LiNGAM、LGM-EV)と同定不能なケース(例:分散が異なる線形ガウス型)の両方をサポートする。
実験結果
リサーチクエスチョン
- RQ1尤度に基づく統合フレームワークは、2段階の補完・発見手法を上回る因果発見性能を示すか?
- RQ2データが完全にランダムに欠損(MCAR)またはランダムに欠損(MAR)する状況下で、MissDAG は真の因果構造をどれほど正確に回復できるか?
- RQ3欠損が生じる状況下で、線形非ガウス型、非線形型、等分散を持つガウス型など、さまざまなANMタイプに対して、MissDAG はどれほど高い正確性を維持できるか?
- RQ4高い欠損率にさらされても、MissDAG は構造学習の正確性と頑健性において、既存の手法を上回るか?
- RQ5MissDAG は、コアフレームワークの再設計なしに、さまざまなスコアベースの因果発見アルゴリズムを柔軟に統合できるか?
主な発見
- MissDAG は、特に高い欠損率下で、ガウス分布に基づくEMで補完した後因果発見を実行する2段階手法(例:Gaussian-EM で補完 → 因果発見)を著しく上回り、正しいDAG構造の回復に優れている。
- シミュレーションでは、非線形型や線形非ガウス型モデルを含む、すべてのテストされたANMタイプにおいて、ベースライン手法よりも高い構造的ハミング距離(SHD)の正確性を達成している。
- Asia ネットワークや Alarm ネットワークなどの実世界データセットにおいても、実世界の欠損パターンに強く、頑健な性能を示している。
- 補完を先に実行する手法と比較して、観測データの尤度が向上しており、真のデータ生成プロセスとより整合していることが示唆される。
- MCEMの統合により、閉形式解が得られない複雑なモデルに対しても、事後分布の不確実性を効果的に処理でき、スケーラビリティが確保されている。
- フレームワークは拡張可能であり、対数行列式項や干渉的制約を含む高度な因果発見アルゴリズムの統合にも対応可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。