[論文レビュー] What's a good imputation to predict with missing values?
本稿は、任意の欠損データメカニズムおよびほとんどすべての補完関数に対して、補完後に回帰を行う手順(impute-then-regress)が漸近的にベイズ最適であることを示しており、条件付き期待値による補完の必要性に疑問を呈する。非線形回帰タスクにおいて、標準的手順よりも優れる、補完と回帰を同時に学習する微分可能なニューラルネットワーク「NeuMiss」を提案する。特に、無視できない欠損(MNAR)条件下で顕著な性能向上を示す。
How to learn a good predictor on data with missing values? Most efforts focus on first imputing as well as possible and second learning on the completed data to predict the outcome. Yet, this widespread practice has no theoretical grounding. Here we show that for almost all imputation functions, an impute-then-regress procedure with a powerful learner is Bayes optimal. This result holds for all missing-values mechanisms, in contrast with the classic statistical results that require missing-at-random settings to use imputation in probabilistic modeling. Moreover, it implies that perfect conditional imputation is not needed for good prediction asymptotically. In fact, we show that on perfectly imputed data the best regression function will generally be discontinuous, which makes it hard to learn. Crafting instead the imputation so as to leave the regression function unchanged simply shifts the problem to learning discontinuous imputations. Rather, we suggest that it is easier to learn imputation and regression jointly. We propose such a procedure, adapting NeuMiss, a neural network capturing the conditional links across observed and unobserved variables whatever the missing-value pattern. Experiments confirm that joint imputation and regression through NeuMiss is better than various two step procedures in our experiments with finite number of samples.
研究の動機と目的
- 欠損値を補完した後予測を行うという広く用いられている手法の理論的裏付けを提供すること。
- 一般の欠損メカニズム下で、条件付き期待値による補完が最適予測に必要かどうかを調査すること。
- 特に最適な回帰関数が不連続になる場合に生じる、補完と回帰の間の乖離を是正すること。
- 補完と回帰を相互に適応させる統合学習フレームワークを提案し、有限標本における性能を向上させること。
- NeuMissによる統合最適化が、標準的な補完後に回帰を行うパイプラインを上回ることを実験的に検証すること。
提案手法
- 理論的分析により、任意の欠損メカニズムおよびほとんどすべての補完関数に対して、強力な学習器を用いた補完後に回帰を行う手法が、漸近的にベイズ最適であることが示された。
- 本稿では、観測済みおよび欠損変数間の条件付き依存関係をモデル化することで、微分可能で統合的な補完と回帰関数を学習する深層ニューラルネットワーク「NeuMiss」を導入した。
- NeuMissは、欠損パターンごとに重みを共有し、欠損マスクを入力表現の一部として統合することで、エンドツーエンドの学習を可能にした。
- 手法は、結果変数の予測誤差を最小化する統合学習目的関数により評価され、補完と回帰の両方を暗黙的に最適化する。
- 実験では、シミュレートされた非線形回帰タスクにおいて、NeuMissを平均値補完、MICE、勾配ブースティング木(GBM)と比較した。マスクの連結有無を含めた設定で評価した。
- ハイパーパrameterは検証セットを用いて調整した。モデルは100,000件のサンプルで学習し、10,000件を検証およびテストに使用した。
実験結果
リサーチクエスチョン
- RQ1補完後に回帰を行う手順は、MAR以外のすべての欠損データメカニズムにおいて理論的に正当化されるか?
- RQ2条件付き期待値を補完関数として用いることで、一般設定下でもベイズ最適な予測子が得られるか?
- RQ3補完と回帰を統合的に学習することは、二段階手法と比較して予測性能を向上させられるか?
- RQ4補完の選択が、得られる回帰関数の連続性と学習可能性に与える影響は?
- RQ5MNAR設定下で欠損マスクを組み込むことは性能向上に寄与するか?また、統合モデルはこの必要性を排除できるか?
主な発見
- 強力な学習器を用いた補完後に回帰を行う手法は、欠損変数の数に関係なく、任意の欠損メカニズムおよびほとんどすべての補完関数に対して、漸近的にベイズ最適である。
- オラクル補完(条件付き期待値)とオラクル回帰関数を連結すると、不連続な回帰関数が得られ、学習が困難で過剰リスクを引き起こす。
- オラクル補完に続くMLPは、あらゆる設定でほぼベイズ性能を達成しており、最適でないものの連続な回帰関数でも良好な性能を発揮できることを示した。
- NeuMissは、平均値補完やMICE補完にマスクを連結した二段階手法を含め、すべての二段階手法を上回った。特にMNAR条件下で顕著な優位性を示した。
- 平均値補完やMICE補完において、欠損マスクを補間データに追加するとMNAR条件下で性能が向上したが、NeuMissは明示的なマスク入力を必要とせず、この情報を内蔵的に捉えている。
- 問題の難易度が上昇する(例:相関係数が低い)と、手法間の性能差は縮小するが、NeuMissはあらゆる設定で一貫した優位性を維持した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。