Skip to main content
QUICK REVIEW

[論文レビュー] Does imputation matter? Benchmark for predictive models

Katarzyna Woźnica, Przemysław Biecek|arXiv (Cornell University)|Jul 6, 2020
Statistical Methods and Bayesian Inference参考文献 10被引用数 13
ひとこと要約

本論文は、13個の実世界の分類データセットを対象に、異なる補完手法が機械学習モデルの予測性能に与える影響を評価する、初めての実験的ベンチマークを提示している。その結果、ランダム補完や平均補完といった単純な手法が、より複雑な手法を上回ることがしばしばあるが、どの手法もすべてのモデルや評価指標において常に優れているわけではないことが判明し、補完戦略、モデルタイプ、性能指標の間には強い相互作用があることが示された。

ABSTRACT

Incomplete data are common in practical applications. Most predictive machine learning models do not handle missing values so they require some preprocessing. Although many algorithms are used for data imputation, we do not understand the impact of the different methods on the predictive models' performance. This paper is first that systematically evaluates the empirical effectiveness of data imputation algorithms for predictive models. The main contributions are (1) the recommendation of a general method for empirical benchmarking based on real-life classification tasks and the (2) comparative analysis of different imputation methods for a collection of data sets and a collection of ML algorithms.

研究の動機と目的

  • 実世界の設定において、補完手法の予測モデル性能への影響を体系的かつ再現可能に評価するためのベンチマークを確立すること。
  • 補完手法と下流のモデル性能を結びつける実験的評価の不足に応えること、特に既存の研究が補完精度にのみ焦点を当てているのとは対照的である。
  • 高度な補完手法が、多様な機械学習アルゴリズムとデータセットにおいて一貫して予測性能を向上させるかどうかを調査すること。
  • 補完戦略、モデルタイプ、評価指標の間の相互作用を調査し、普遍的な推奨事項に挑戦する複雑な依存関係を明らかにすること。

提案手法

  • OpenML100に収録された13個の実世界の二値分類データセット(少なくとも1つの特徴量に欠損値を含む)を用いる。
  • 各データセットを80%の訓練データと20%のテストデータに分割し、未知のデータに対するモデル性能を評価する。
  • 7つの補完手法(平均、ランダム、softImpute、missForest、VIM_hotdeck、VIM_kknn、mice_default)を評価し、各データセットごとに成功率を報告する。
  • F1スコアとAUCを評価指標として用い、各補完済み訓練セットで5つの機械学習モデル(glmnet、kknn、ranger、rpart、xgboost)を学習し、テストセットで性能を評価する。
  • 性能は、データセット全体で平均順位を用いて集約する。補完手法とモデルの間の相互作用を可視化するために主成分分析(PCA)を用いる。
  • グリーディサーチにより、複数のデータセットとモデルで最良の構成をカバーする補完手法の最適な順序を同定する。

実験結果

リサーチクエスチョン

  • RQ1異なる補完手法は、実世界のデータにおける機械学習モデルの予測性能にどのように影響するか?
  • RQ2多様なデータセットと機械学習アルゴリズムにおいて、普遍的に最良の補完手法は存在するか?
  • RQ3評価指標(F1対AUC)の選択が、補完手法の順位付けにどのように影響するか?
  • RQ4特定の補完手法と特定の機械学習モデルとの間に、どのような相互作用があるか?
  • RQ5メタラーニング的手法は、補完戦略、データ構造、モデル性能の間の複雑で非一様な関係を捉えることができるか?

主な発見

  • F1スコアの最良構成の75%以上で、ランダム補完や平均補完といった単純な補完手法が最良の性能を示した。
  • AUCの観点では、平均補完とVIM_kknn、もしくはmice_defaultの組み合わせが最良の性能を示したが、missForestやランダム補完も非常に競争力がある。
  • どの補完手法も、すべてのモデルや指標において常に最良の順位を保証するものではない。性能は評価指標の選択に強く依存する。
  • missForestは、複数のモデルや指標において最上位またはその近辺の順位を達成しており、特にF1スコアの性能で顕著に優れていた。
  • PCA分析により、補完手法がモデル適合性に基づいて明確にクラスタリングされていることが判明した:平均、missForest、VIM_kknnはrpartやkknnと相性が良く、miceはrangerやxgboostと相性が良い。
  • グリーディサーチの結果、ランダム補完、missForest、ホットデッキ補完を組み合わせることで、F1スコアの最良構成の75%以上をカバーでき、相乗効果が顕著に現れた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。