[論文レビュー] To Impute or not to Impute? Missing Data in Treatment Effect Estimation
本稿では、治療割り当てに影響されると同時に影響を受けるという、治療効果推定における新しい欠損メカニズム「混合混同欠損(MCM)」を導入する。著者らは、特定の変数(治療によって引き起こされない欠損のもの、特に $\widetilde{X}^\dagger$ でないもの)にのみ補完を行う「選択的補完」を提案し、情報的欠損を除去するか、共変量シフトを導入するのを避けることで、複数の学習者において平均処置効果(ATE)および条件付き平均処置効果(CATE)の推定を著しく改善する。
Missing data is a systemic problem in practical scenarios that causes noise and bias when estimating treatment effects. This makes treatment effect estimation from data with missingness a particularly tricky endeavour. A key reason for this is that standard assumptions on missingness are rendered insufficient due to the presence of an additional variable, treatment, besides the input (e.g. an individual) and the label (e.g. an outcome). The treatment variable introduces additional complexity with respect to why some variables are missing that is not fully explored by previous work. In our work we introduce mixed confounded missingness (MCM), a new missingness mechanism where some missingness determines treatment selection and other missingness is determined by treatment selection. Given MCM, we show that naively imputing all data leads to poor performing treatment effects models, as the act of imputation effectively removes information necessary to provide unbiased estimates. However, no imputation at all also leads to biased estimates, as missingness determined by treatment introduces bias in covariates. Our solution is selective imputation, where we use insights from MCM to inform precisely which variables should be imputed and which should not. We empirically demonstrate how various learners benefit from selective imputation compared to other solutions for missing data. We highlight that our experiments encompass both average treatment effects and conditional average treatment effects.
研究の動機と目的
- 欠損の原因と処置割り当ての間の複雑な依存関係により、標準的な補完手法が失敗する治療効果推定における欠損データの課題に対処すること。
- 欠損が処置割り当ての原因にもなると同時にその結果にもなるという事態が、既存の欠損メカニズムでは捉えられていないことを特定すること。
- 処置選択と結果推定の両方において欠損が果たす二重の役割をモデル化するため、新しい欠損メカニズム「混合混同欠損(MCM)」を提案すること。
- 単純な補完や補完なしのアプローチが、処置効果推定にバイアスをもたらすことが示され、より洗練された手法の必要性を示すこと。
- 処置に情報をもたらす欠損の性質を保ちつつ、共変量シフトを是正する、選択的補完戦略を開発・検証すること。
提案手法
- 処置と欠損の間の双方向的依存関係を含む、標準的な欠損メカニズム(MCAR、MAR)を拡張したグラフィカルモデルとして、混合混同欠損(MCM)を導入する。
- 処置 $W$ が共変量(例:$\widetilde{X}$ と $Z$)の欠損を引き起こすと同時に、その欠損によっても影響を受ける構造的因果モデルとして、MCMを形式化する。
- 処置によって引き起こされない欠損(すなわち、$\widetilde{X}^\dagger$ でないもの)の変数にのみ補完を行う「選択的補完」を提案し、処置に情報をもたらす欠損を保持する。
- MICE(連鎖式方程式による複数補完)を用いて補完を実行し、MCM分析に基づく選択的適用を実施する。
- T-learner、DR-learner、X-learnerの各モデルにXGBoostを用い、ATE(MSEを用いて)、CATE(PEHEを用いて)の指標で性能を評価する。
- 選択的補完と統合された逆確率プロパティ重み付け(IPW)をDRおよびX-learnerに適用し、選択バイアスを補正する。
実験結果
リサーチクエスチョン
- RQ1処置選択の原因にもなると同時にその原因にもなる欠損が、治療効果推定にどのように影響するか?
- RQ2このようなメカニズム下で、すべての欠損変数を単純に補完することはどのような結果をもたらすか?
- RQ3特定の欠損変数にのみ補完を行う「選択的補完」は、全変数補完や補完なしと比較して、治療効果推定を改善できるか?
- RQ4T-learner、DR-learner、X-learnerといった異なる治療効果学習者において、選択的補完は他の欠損データ戦略と比較してどのように性能を発揮するか?
- RQ5選択的補完は、平均処置効果(ATE)および条件付き平均処置効果(CATE)推定の両方においてバイアスを低減するか?
主な発見
- すべての欠損変数を補完すると、処置に情報をもたらす欠損の性質が失われ、選択バイアスが増加するため、性能が著しく低下する。
- すべての変数を補完しないままにすると、処置によって引き起こされる欠損が処置群と対照群の間で共変量シフトを引き起こし、バイアスが生じる。
- 特に $\widetilde{X}$ のみを補完し、$\widetilde{X}^\dagger$ を補完しない「選択的補完」は、すべての学習者においてATE推定のMSEを著しく低減する。
- CATE推定においては、選択的補完がPEHE(異質的効果推定の精度)を最低に抑え、全補完や補完なしを上回る性能を示す。
- 選択的補完の改善効果は、T-learner、DR-learner、X-learnerの複数の学習者において一貫しており、その堅牢性が裏付けられる。
- 実証的結果から、誤った変数(例:$\widetilde{X}^\dagger$)を補完することは一貫して性能を低下させることを確認し、MCMの理論的根拠が裏付けられる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。