Skip to main content
QUICK REVIEW

[論文レビュー] Random Forest Missing Data Algorithms

Fei Tang, Hemant Ishwaran|arXiv (Cornell University)|Jan 19, 2017
Bayesian Methods and Mixture Models参考文献 18被引用数 6
ひとこと要約

本研究では、欠損データに対するランダムフォレストベースの補完アルゴリズムを評価し、特徴量間相関が高くなるほど性能が顕著に向上することを示している。手法のうち、missForestが最も高い正確性を達成している一方、計算効率に優れた変種であるmForestは、正確性の損失を最小限に抑えながら最大10倍の高速化を実現し、大規模データに適している。

ABSTRACT

Random forest (RF) missing data algorithms are an attractive approach for dealing with missing data. They have the desirable properties of being able to handle mixed types of missing data, they are adaptive to interactions and nonlinearity, and they have the potential to scale to big data settings. Currently there are many different RF imputation algorithms but relatively little guidance about their efficacy, which motivated us to study their performance. Using a large, diverse collection of data sets, performance of various RF algorithms was assessed under different missing data mechanisms. Algorithms included proximity imputation, on the fly imputation, and imputation utilizing multivariate unsupervised and supervised splitting---the latter class representing a generalization of a new promising imputation algorithm called missForest. Performance of algorithms was assessed by ability to impute data accurately. Our findings reveal RF imputation to be generally robust with performance improving with increasing correlation. Performance was good under moderate to high missingness, and even (in certain cases) when data was missing not at random.

研究の動機と目的

  • さまざまな欠損データメカニズム下でのさまざまなランダムフォレスト補完アルゴリズムの性能を評価すること。
  • 異なるデータ設定において、最も正確で計算効率の高いRFベースの補完手法を特定すること。
  • 欠損データ状況下における特徴量相関が補完正確性に与える影響を評価すること。
  • 高次元データ向けに、missForestの計算効率の高い代替手法mForestを提案・検証すること。
  • データサイズ、欠損の種別、計算制約に基づいてRF補完手法を選定する実用的ガイドラインを提供すること。

提案手法

  • 本研究では、近接性補完、オンザフライ補完(OTFI)、およびmissForest型手法を含む複数のRF補完アルゴリズムを評価した。
  • 変数をグループ化することで、回帰回数をpから約1/αに削減する新しい多変量補完アルゴリズムmForestを提案した。ここでαはグループのサイズ割合である。
  • 相対的補完誤差(ℛR(ℐ))を用いて、MCAR、MAR、NMARメカニズム下で60の多様なデータセットに対して補完正確性を測定した。
  • サンプルサイズ(n = 100~2000)、欠損度(25%)、相関構造の変動を想定し、アルゴリズムをテストした。
  • 実行時間の測定により計算効率を評価し、mForestは個々の変数ごとのフォレストを別々に走らせる負担を軽減することを目的として設計された。
  • 合成モデルを用いたシミュレーションでは、相関のある予測子と混合データ型(正規分布、指数分布、カテゴリカル)を想定し、制御された条件下でのロバストネスをテストした。

実験結果

リサーチクエスチョン

  • RQ1特徴量相関は、ランダムフォレスト補完アルゴリズムの正確性にどのように影響するか?
  • RQ2多様なデータ型および欠損データメカニズム下で、どのランダムフォレスト補完手法が最も高い補完正確性を示すか?
  • RQ3高い欠損度および複雑な欠損メカニズム下で、missForestの性能は他のRF補完手法と比べてどうか?
  • RQ4mForestは、missForestと同等の正確性を達成しながら、計算時間を著しく短縮できるか?
  • RQ5大規模データ環境下で、補完正確性と計算効率のトレードオフはどのようなものか?

主な発見

  • すべてのRFアルゴリズムにおいて、特徴量相関が高くなるほど補完正確性が顕著に向上し、高い欠損度や複雑な欠損メカニズム下でも同様の傾向が見られた。
  • missForestは一貫して最高の補完正確性を達成しており、他のRFベースの手法やk-NN、MICEといった従来手法を上回った。
  • mForestは、missForestと比較して最大10倍の計算時間短縮を達成し、正確性の損失はわずかにとどまり、特に大きなグループサイズ(α ≥ 0.1)では顕著であった。
  • オンザフライ補完(OTFI)手法、特に非監視型RF補完は、missForestと比べて100~1000倍の高速化を達成し、良好な補完性能を示したため、大規模データに適していた。
  • 欠損データメカニズムが複雑になる(MCARからNMARに移行する)ほど性能が系統的に低下したが、特に高い相関下ではRF手法がロバストであることが確認された。
  • 本研究では、相関がRF補完において重要な要因であることが確認された。高い相関により、ランダムフォレストに内蔵された適応的最近傍探索機構が、データ構造をより効果的に活用できるようになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。