Skip to main content
QUICK REVIEW

[論文レビュー] Are deep learning models superior for missing data imputation in large surveys? Evidence from an empirical comparison

Zhenhua Wang, Olanrewaju Akande|arXiv (Cornell University)|Mar 14, 2021
Statistical Methods and Bayesian Inference参考文献 42被引用数 11
ひとこと要約

本研究では、アメリカ合衆国国勢調査の実際の調査データを用い、分類木およびランダムフォレストを用いたMICEと比較して、深層学習による補完手法(GAINおよびMIDA)の性能を評価している。計算効率に優れるものの、多様な欠損データの設定、特に中程度のサンプルサイズと単純なデータ構造下では、バイアス、平均二乗誤差、信頼性区間のカバレッジの観点で、深層学習モデルはMICEと分類木の組み合わせに劣っている。

ABSTRACT

Multiple imputation (MI) is a popular approach for dealing with missing data arising from non-response in sample surveys. Multiple imputation by chained equations (MICE) is one of the most widely used MI algorithms for multivariate data, but it lacks theoretical foundation and is computationally intensive. Recently, missing data imputation methods based on deep learning models have been developed with encouraging results in small studies. However, there has been limited research on evaluating their performance in realistic settings compared to MICE, particularly in big surveys. We conduct extensive simulation studies based on a subsample of the American Community Survey to compare the repeated sampling properties of four machine learning based MI methods: MICE with classification trees, MICE with random forests, generative adversarial imputation networks, and multiple imputation using denoising autoencoders. We find the deep learning imputation methods are superior to MICE in terms of computational time. However, with the default choice of hyperparameters in the common software packages, MICE with classification trees consistently outperforms, often by a large margin, the deep learning imputation methods in terms of bias, mean squared error, and coverage under a range of realistic settings.

研究の動機と目的

  • 大規模な調査データにおける深層学習による補完手法(GAINおよびMIDA)の性能を、従来のMICE手法と比較して評価すること。
  • 深層学習モデルが、MICEと分類木およびランダムフォレストを組み合わせた手法に比べて、バイアス、平均二乗誤差、信頼性区間のカバレッジにおいて有意義な改善をもたらすかどうかを評価すること。
  • 実際の現場で一般的に用いられる設定であるデフォルトのハイパーパrameter設定が、深層学習による補完手法の性能に与える影響を調査すること。
  • 中程度の次元数と単純な構造を持つ調査データに対して、深層ニューラルネットワークが適しているかどうかを特定すること。
  • 現実的な欠損データメカニズム下での複数補完における深層学習手法の信頼性に関する実証的証拠を提供すること。

提案手法

  • アメリカ合衆国国勢調査のサブサンプルに基づく広範なシミュレーション研究を実施し、現実的な欠損データパターンを生成した。
  • 4つの補完手法を比較した:分類木を用いたMICE、ランダムフォレストを用いたMICE、GAIN(生成対抗的補完ネットワーク)、MIDA(ノイズ除去オートエンコーダーを用いた複数補完)。
  • 繰り返しサンプリングを用いて、複数の推定対象および欠損データメカニズム下でバイアス、平均二乗誤差(MSE)、信頼性区間のカバレッジを評価した。
  • 実際の調査構造に基づく合成データと、先行研究のベンチマークデータセットを用いて性能を評価した。
  • 一般的なソフトウェアパッケージのデフォルトハイパーパrameterを適用し、通常の実務者による使用状況を反映した。過剰なチューニングを避けるため、調整を最小限に抑えた。
  • 全体のMSEおよび精度の結果を報告し、繰り返しサンプル間での補完の安定性を評価した。

実験結果

リサーチクエスチョン

  • RQ1現実的な調査データの条件下で、深層学習による補完手法(GAINおよびMIDA)は、分類木を用いたMICEに比べてバイアス、MSE、信頼性区間のカバレッジにおいて優れているか?
  • RQ2大規模な調査データセットに適用した場合、深層学習モデルの計算効率はMICE手法と比べてどの程度高いか?
  • RQ3一般的なソフトウェアパッケージに組み込まれたデフォルトのハイパーパrameter設定が、深層学習による補完手法の性能にどの程度の影響を及ぼすか?
  • RQ4GAINおよびMIDAは、MICEと分類木の組み合わせと比較して、繰り返しサンプリングにおいて著しく高い変動性を示すのはなぜか?
  • RQ5深層学習モデルとMICEと分類木の間の性能格差は、データ構造の単純さに起因するのか、それとも十分な訓練サンプルサイズが不足しているためなのか?

主な発見

  • GAINおよびMIDAはGPUアクセcelerationのおかげで、MICE手法に比べて著しく高速であり、明確な計算上の利点を示している。
  • 高速な計算にもかかわらず、GAINおよびMIDAは、すべてのシミュレーション設定において、バイアス、平均二乗誤差、信頼性区間のカバレッジの観点で、MICEと分類木の組み合わせに一貫して劣っている。
  • MICEと分類木の組み合わせは、連続変数を含む設定や中程度のサンプルサイズ下では、深層学習モデルを大幅に上回った。
  • GAINおよびMIDAは繰り返しサンプリングにおいて極めて不安定な補完を生じさせ、高い変動性を示しており、繰り返しサンプリングの性質における信頼性の低さが示された。
  • デフォルトのハイパーパrameter設定を用いても性能格差は継続しており、これは問題が単に最適でないチューニングに起因するわけではないことを示唆している。
  • アンサンブル手法としてのランダムフォレストは、MICEにおける単一の分類木よりも性能を向上させず、計算コストも高かった。これは、実務上ではMICEと分類木の組み合わせがより好ましいことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。