Skip to main content
QUICK REVIEW

[論文レビュー] Evolving imputation strategies for missing data in classification problems with TPOT

Unai Garciarena, Roberto Santana|arXiv (Cornell University)|Jun 4, 2017
Data Mining Algorithms and Applications参考文献 15被引用数 10
ひとこと要約

本論文では、分類タスクにおける欠損データの処理のための補完戦略を含む最適な機械学習パイプラインを自動的に進化させるために、TPOTフレームワーク内での遺伝的プログラミングの使用を提案する。このアプローチは、静的補完選択に比べ、補完手法と分類器の最良の組み合わせを動的に選択することで、欠損値を含む多様なデータセットにおいて分類精度を顕著に向上させる。

ABSTRACT

Missing data has a ubiquitous presence in real-life applications of machine learning techniques. Imputation methods are algorithms conceived for restoring missing values in the data, based on other entries in the database. The choice of the imputation method has an influence on the performance of the machine learning technique, e.g., it influences the accuracy of the classification algorithm applied to the data. Therefore, selecting and applying the right imputation method is important and usually requires a substantial amount of human intervention. In this paper we propose the use of genetic programming techniques to search for the right combination of imputation and classification algorithms. We build our work on the recently introduced Python-based TPOT library, and incorporate a heterogeneous set of imputation algorithms as part of the machine learning pipeline search. We show that genetic programming can automatically find increasingly better pipelines that include the most effective combinations of imputation methods, feature pre-processing, and classifiers for a variety of classification problems with missing data.

研究の動機と目的

  • 欠損データを含む分類タスクにおける最適な補完手法の選択という課題に取り組むこと。従来は顕著な手動チューニングを要する。
  • TPOT自動機械学習フレームワークを拡張し、補完をパイプラインコンponentとしてネイティブにサポートすること。
  • 遺伝的プログラミングが、データ固有の補完および分類アルゴリズムの優れた組み合わせを発見できるかどうかを調査すること。
  • 多様なデータセットにおける異なる欠損データパターンとレベルを想定して、進化したパイプラインのパフォーマンスを評価すること。
  • 進化したパイプラインにおける効果的な補完手法と後続分類器との関係を分析すること。

提案手法

  • 著者らは、Pythonベースの自動機械学習ライブラリであるTPOTを拡張し、多様な補完アルゴリズムを構成可能なパイプラインコンponentとして統合した。
  • 遺伝的プログラミングを用いて、前処理、特徴選択、補完、分類ステップを含むエンドツーエンドの機械学習パイプラインを進化させた。
  • 実世界のデータセットにおいて、制御されたメカニズムを用いて欠損データをシミュレートし、MCAR、MAR、MNARのパターンを生成して評価した。
  • フィットネス関数は、分類精度に基づいてパイプラインのパフォーマンスを評価し、保留済みテストセットでの誤差を最小化することに注力した。
  • 進化的な探索により、補完手法(例:平均値、中央値、最頻値、MICE)と分類器(例:ランダムフォレスト、XGBoost、勾配ブースティング)の組み合わせを探索し、パフォーマンスを最適化した。
  • 最良のパフォーマンスを示したパイプラインに対して統計的分析を実施し、効果的な補完器-分類器ペアの繰り返しパターンを同定した。

実験結果

リサーチクエスチョン

  • RQ1欠損データが存在する状況において、遺伝的プログラミングは補完および分類アルゴリズムの最適な組み合わせを効果的に探索できるか?
  • RQ2どの補完手法が、欠損値を含む多様なデータセットにおいて一貫して高い分類精度をもたらすか?
  • RQ3異なる欠損データパターン(MCAR、MAR、MNAR)は、進化したパイプラインのパフォーマンスにどのように影響するか?
  • RQ4高パフォーマンスのパイプラインに頻繁に出現する特定の分類器-補完ペアは存在するか?
  • RQ5TPOTに補完を統合することで、自動機械学習パイプライン全体のパフォーマンスと頑健性にどのような影響が生じるか?

主な発見

  • 遺伝的プログラミングアプローチは、欠損データを含む複数のデータセットにおいて一貫して分類精度を向上させ、自動パイプライン探索の有効性を示した。
  • 単一の補完手法が他のすべての手法を普遍的に上回ることはなく、むしろデータセットや欠損データパターンによってパフォーマンスが顕著に変動した。
  • 最も頻繁に使用された補完手法が全体として最高の精度を達成したが、中央値による補完は多様なデータセットにおいてより頻繁に選択された。
  • 勾配ブースティング分類器は、中央値または最頻値による補完戦略と組み合わせると優れたパフォーマンスを示した。
  • 進化したパイプラインは、特に低~中程度の欠損度において、単純な補完手法がより複雑な手法を上回ることが多いことを明らかにした。
  • 補完をTPOTに統合することで、探索空間が拡大され、欠損データに耐性のない分類器ですらパイプライン内で使用可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。