[論文レビュー] Bootstrapping and Multiple Imputation Ensemble Approaches for Missing Data
本稿では、欠損データ下での分類性能を向上させるために、ブートストラップ法と複数代入法を組み合わせたアンサンブル手法を提案する。不完全なデータに対して期待値最大化(EM)による代入とバギングを統合することで、特に高い欠損度(最大30%)において、高い精度と多様性を達成し、単一代入法や他のアンサンブル戦略を上回る性能を示した。UCIの8つのデータセットを用いた広範な実験でその有効性が確認された。
Presence of missing values in a dataset can adversely affect the performance of a classifier. Single and Multiple Imputation are normally performed to fill in the missing values. In this paper, we present several variants of combining single and multiple imputation with bootstrapping to create ensembles that can model uncertainty and diversity in the data, and that are robust to high missingness in the data. We present three ensemble strategies: bootstrapping on incomplete data followed by (i) single imputation and (ii) multiple imputation, and (iii) multiple imputation ensemble without bootstrapping. We perform an extensive evaluation of the performance of the these ensemble strategies on 8 datasets by varying the missingness ratio. Our results show that bootstrapping followed by multiple imputation using expectation maximization is the most robust method even at high missingness ratio (up to 30%). For small missingness ratio (up to 10%) most of the ensemble methods perform quivalently but better than single imputation. Kappa-error plots suggest that accurate classifiers with reasonable diversity is the reason for this behaviour. A consistent observation in all the datasets suggests that for small missingness (up to 10%), bootstrapping on incomplete data without any imputation produces equivalent results to other ensemble methods.
研究の動機と目的
- 機械学習における欠損データによる分類器性能の低下という課題に対処すること。
- 不確実性とデータの多様性をモデル化するため、ブートストラップ法と複数代入法を組み合わせたアンサンブル戦略を評価すること。
- 実世界のデータセットにおける高い欠損度比(最大30%)に対して最も頑健なアプローチを特定すること。
- さまざまな代入法およびアンサンブル手法における、精度、多様性、計算コストのトレードオフを分析すること。
- 欠損度に応じた最適な代入法およびアンサンブル戦略の選定に関する、データサイエンティスト向けの根拠に基づくガイダンスを提供すること。
提案手法
- 3つのアンサンブル戦略を提案する:(i) 不完全なデータに対するブートストラップの後、単一代入を行う、(ii) 不完全なデータに対するブートストラップの後、複数代入を行う、(iii) ブートストラップなしの複数代入。
- アンサンブルフレームワーク内での基本的な代入手法として、期待値最大化(EM)、平均代入、ランダム代入を用いる。
- アンサンブルは、ブートストラップ標本に基づいて学習された25個の基本分類器を使用し、予測は多数決による集約を行う。
- 分類器の多様性(カッパ)と平均誤差(E_ij)のトレードオフを可視化するために、カッパ-誤差プロットを用いる。最適なペアは左下の象限に位置する。
- 8つのUCIデータセットを用い、欠損度比が5%から30%の範囲で、10分割交差検証を用いて性能を評価する。
- 本研究ではMCAR(完全に無作為に欠損する)欠損の状況に焦点を当てており、この仮定のもとで結果の有効性を保証する。
実験結果
リサーチクエスチョン
- RQ1欠損度が増加する条件下で、ブートストラップと単一代入の組み合わせ、ブートストラップと複数代入の組み合わせ、またはブートストラップなしの複数代入という3つのアンサンブル戦略のうち、どれが最も優れた性能を示すか?
- RQ2欠損度比が5%から30%に変化する条件下で、アンサンブル手法と単一代入法の性能を比較すると、どのように異なるか?
- RQ3カッパ-誤差プロットは、欠損データ下でのアンサンブル分類器における多様性と精度の関係をどの程度明らかにしているか?
- RQ4低欠損度(≤10%)において、代入を一切行わない不完全なデータに対するブートストラップ(BagNoImp)は、代入に基づくアンサンブルと同等の性能を示すか?
- RQ5代入手法の選択(EM、平均、ランダム)が、アンサンブルの頑健性および計算コストに与える影響はどの程度か?
主な発見
- 期待値最大化(EM)を用いたブートストラップと複数代入の組み合わせ(BagEM)によるアンサンブル手法が最も頑健であり、30%の欠損度でも高い性能を維持した。
- 低欠損度(10%まで)においては、代入を一切行わない不完全なデータに対するブートストラップ(BagNoImp)が、すべての代入ベースのアンサンブルと同等の性能を示した。これは、このような状況では代入の必要性が最小限であることを示唆している。
- カッパ-誤差プロットの結果、BagEMは高い精度と適度な多様性を持つ分類器を生成しており、これが高欠損度下での優れた頑健性の理由を説明している。
- ブートストラップ後に平均代入を適用した複数代入(BagMIGRandI)は、低欠損度(≤10%)においてEMベースの代入よりも高速で、頑健な代替手法である。
- 単一代入は、欠損度が10%を超えると、アンサンブル手法に比べて一貫して性能が劣り、特に欠損度が増加するにつれて顕著に劣化した。
- EMによる代入をブートストラップ後に適用した場合、30%の欠損度でも性能の低下はわずかに抑えられ、データの不完全性に対する強い耐性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。