Skip to main content
QUICK REVIEW

[论文解读] Classification and regression tree methods for incomplete data from sample surveys

Wei‐Yin Loh, John L. Eltinge|arXiv (Cornell University)|Mar 4, 2016
Statistical Methods and Bayesian Inference参考文献 5被引用 9
一句话总结

本文提出使用分类与回归树(CART)和随机森林方法处理具有缺失结果和辅助变量的不完整调查数据,在偏差、均方误差、计算速度和高维预测变量的可扩展性方面,相较于标准插补和加权方法表现出更优性能,基于美国消费者支出调查的真实数据进行验证。

ABSTRACT

Analysis of sample survey data often requires adjustments to account for missing data in the outcome variables of principal interest. Standard adjustment methods based on item imputation or on propensity weighting factors rely heavily on the availability of auxiliary variables for both responding and non-responding units. Application of these adjustment methods can be especially challenging in cases for which the auxiliary variables are numerous and are themselves subject to substantial incomplete-data problems. This paper shows how classification and regression trees and forests can overcome some of the computational difficulties. An in-depth simulation study based on incomplete-data patterns encountered in the U.S. Consumer Expenditure Survey is used to compare the methods with two standard methods for estimating a population mean in terms of bias, mean squared error, computational speed and number of variables that can be analyzed.

研究动机与目标

  • 解决在结果变量和辅助变量均存在缺失数据时,估计样本调查中总体均值的挑战。
  • 克服标准方法(如多重插补和逆概率加权)在处理高维、不完整辅助数据时面临的计算和建模限制。
  • 评估基于树的方法(如CART和随机森林)是否能为不完整调查数据提供更稳健、更快、更具可扩展性的解决方案。
  • 从偏差、均方误差、计算效率以及处理大量预测变量的能力等方面,将基于树的方法与既有的成熟方法进行比较。

提出的方法

  • 作者将分类与回归树(CART)和随机森林应用于建模结果变量与辅助预测变量之间的关系,即使辅助变量本身也含有缺失值。
  • 利用树模型的预测均值对缺失结果值进行插补,构建一种预测均值模型,避免强参数假设。
  • 该方法通过递归划分识别具有相似响应模式的子群,实现在无需完整数据假设条件下的非参数缺失值估计。
  • 为提高计算效率,采用随机森林的集成学习方法,以降低方差并提升插补值的预测准确性。
  • 将该方法与标准方法(如基于链式方程的多重插补(MICE)、AMELIA和逆概率加权(IPW))进行比较,基于美国消费者支出调查中真实存在的不完整数据模式开展模拟研究。
  • 通过偏差、均方误差、计算速度以及可有效处理的预测变量数量等指标评估基于树方法的性能。

实验结果

研究问题

  • RQ1当辅助变量本身也存在缺失时,分类与回归树能否有效处理调查结果中的缺失数据?
  • RQ2在估计总体均值方面,基于树的方法与标准插补和加权技术相比,在偏差和均方误差方面表现如何?
  • RQ3CART和随机森林在具有缺失值的高维预测变量集合中,其可扩展性达到何种程度?
  • RQ4与传统多重插补或基于EM的方法相比,基于树的插补是否能显著提升计算速度?
  • RQ5在大型调查(如美国消费者支出调查)中观察到的真实缺失数据模式下,基于树的方法表现如何?

主要发现

  • 在复杂缺失数据模式下估计总体均值时,基于树的方法所获得的偏差低于MICE和IPW等标准方法。
  • 该方法在高维且相关性强的辅助变量场景下,表现出低于传统方法的均方误差。
  • 计算速度显著快于MICE和AMELIA,能够高效处理数千个预测变量。
  • 随机森林在降低方差和提升预测准确性方面优于单棵决策树,尤其在存在缺失预测变量的高维场景中表现更优。
  • 该方法在无需完整案例分析或强参数假设的前提下,成功处理了不完整的辅助变量。
  • 该方法在多种缺失数据机制下均保持稳健性能,尤其在预测变量数量超过样本量时表现尤为出色。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。