Skip to main content
QUICK REVIEW

[論文レビュー] Classification and regression tree methods for incomplete data from sample surveys

Wei‐Yin Loh, John L. Eltinge|arXiv (Cornell University)|Mar 4, 2016
Statistical Methods and Bayesian Inference参考文献 5被引用数 9
ひとこと要約

本稿では、欠損のある結果変数と補助変数を伴う不完全な調査データを処理するために、分類および回帰木(CART)とランダムフォレストを用いる手法を提案し、実世界の米国消費者支出調査のデータを用いて、標準的な補完法や重み付け法と比較して、バイアス、平均二乗誤差、計算速度、予測子の次元が高い場合のスケーラビリティの面で優れた性能を示した。

ABSTRACT

Analysis of sample survey data often requires adjustments to account for missing data in the outcome variables of principal interest. Standard adjustment methods based on item imputation or on propensity weighting factors rely heavily on the availability of auxiliary variables for both responding and non-responding units. Application of these adjustment methods can be especially challenging in cases for which the auxiliary variables are numerous and are themselves subject to substantial incomplete-data problems. This paper shows how classification and regression trees and forests can overcome some of the computational difficulties. An in-depth simulation study based on incomplete-data patterns encountered in the U.S. Consumer Expenditure Survey is used to compare the methods with two standard methods for estimating a population mean in terms of bias, mean squared error, computational speed and number of variables that can be analyzed.

研究の動機と目的

  • 結果変数および補助変数に欠損が生じる状況下で、母平均を推定する課題に対処すること。
  • 高次元の不完全な補助変数を扱う際、多重補完法や逆確率重み付け(IPW)といった標準的手法に伴う計算およびモデル化の制限を克服すること。
  • 分類および回帰木(CART)やランダムフォレストといった木ベースの手法が、不完全な調査データに対してより頑健で、高速かつスケーラブルな解決策を提供できるかどうかを評価すること。
  • バイアス、平均二乗誤差、計算効率、多数の予測子を扱える能力の観点から、木ベースの手法を確立された手法と比較すること。

提案手法

  • 著者らは、補助変数自体に欠損がある場合でさえも、結果変数と補助予測子の関係をモデル化するために分類および回帰木(CART)とランダムフォレストを適用した。
  • 木モデルからの予測平均値を用いて欠損した結果変数の値を補完し、強いパラメトリック仮定を必要としない予測平均モデルを構築した。
  • 再帰的分割を活用して、類似した反応パターンを示すサブグループを同定し、完全データの仮定を必要としない非パラメトリックな欠損値推定を可能にした。
  • 計算効率を向上させるために、アンサンブル学習を用いてランダムフォレストにより、補完値の分散を低減し、予測精度を向上させた。
  • シミュレーションスタディを用いて、米国消費者支出調査から得た実際の不完全データパターンに基づき、標準的手法(多重補完法による連鎖的補完法(MICE)、AMELIA、逆確率重み付け(IPW))と比較した。
  • バイアス、平均二乗誤差、計算速度、および効果的に扱える予測子の数の観点から、木ベースの手法の性能を評価した。

実験結果

リサーチクエスチョン

  • RQ1補助変数自体に欠損がある状況下で、分類および回帰木が、結果変数の欠損データを効果的に処理できるか。
  • RQ2バイアスおよび平均二乗誤差の観点から、木ベースの手法は、母平均推定において、標準的な補完法や重み付け手法と比べてどのように異なるか。
  • RQ3CARTおよびランダムフォレストは、欠損のある調査データにおいて、高次元の予測子セットにどの程度スケーリングできるか。
  • RQ4従来の多重補完法やEMベースの手法と比較して、木ベースの補完法は計算速度をどのように向上させるか。
  • RQ5米国消費者支出調査のような大規模調査で観察される現実的な欠損データパターン下で、木ベースの手法はどの程度の性能を示すか。

主な発見

  • 複雑な欠損データパターン下で母平均を推定する際、木ベースの手法はMICE や IPW といった標準的手法よりも低いバイアスを達成した。
  • 特に高次元で相関の高い補助変数を伴う状況では、従来のアプローチよりも平均二乗誤差が低かった。
  • MICE や AMELIA よりも著しく高速な計算速度を示し、数千の予測子変数を効率的に処理できる能力を有した。
  • 欠損のある予測子を伴う高次元の設定において、ランダムフォレストは単一の木よりも分散を低減し、予測精度を向上させた。
  • 完全ケース分析や強いパラメトリック仮定を必要とせず、不完全な補助変数を効果的に処理できた。
  • さまざまな欠損データメカニズムにわたり、頑健な性能を維持した。特に予測子の数が標本サイズを上回る場合に顕著な効果を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。