[论文解读] Random Forest Missing Data Algorithms
本研究评估了基于随机森林的缺失数据填补算法,表明当特征相关性较高时,性能显著提升。在各类方法中,missForest 的准确度最高,而其计算效率更高的变体 mForest 在仅造成轻微准确度损失的情况下实现了最高 10 倍的加速,适用于大规模数据。
Random forest (RF) missing data algorithms are an attractive approach for dealing with missing data. They have the desirable properties of being able to handle mixed types of missing data, they are adaptive to interactions and nonlinearity, and they have the potential to scale to big data settings. Currently there are many different RF imputation algorithms but relatively little guidance about their efficacy, which motivated us to study their performance. Using a large, diverse collection of data sets, performance of various RF algorithms was assessed under different missing data mechanisms. Algorithms included proximity imputation, on the fly imputation, and imputation utilizing multivariate unsupervised and supervised splitting---the latter class representing a generalization of a new promising imputation algorithm called missForest. Performance of algorithms was assessed by ability to impute data accurately. Our findings reveal RF imputation to be generally robust with performance improving with increasing correlation. Performance was good under moderate to high missingness, and even (in certain cases) when data was missing not at random.
研究动机与目标
- 评估不同随机森林填补算法在多种缺失数据机制下的性能。
- 确定在不同数据环境下,哪些基于随机森林的填补方法在准确度和计算效率方面表现最优。
- 评估特征相关性对缺失数据场景下填补准确度的影响。
- 开发并测试一种计算高效的 missForest 替代方法 mForest,适用于高维数据。
- 根据数据规模、缺失类型和计算约束,为选择随机森林填补方法提供实际指导。
提出的方法
- 本研究评估了多种随机森林填补算法:邻近度填补、实时填补(OTFI)以及类似 missForest 的方法。
- 提出一种新型多变量填补算法 mForest,通过将变量分组,将回归次数从 p 减少至约 1/α,其中 α 为分组大小比例。
- 在 MCAR、MAR 和 NMAR 机制下,基于 60 个多样化数据集,使用相对填补误差(ℛR(ℐ))衡量填补准确度。
- 在不同样本量(n = 100 至 2000)、缺失水平(25%)和相关性结构下测试算法性能。
- 通过测量运行时间评估计算效率,mForest 的设计旨在减轻为每个变量独立运行森林带来的计算负担。
- 模拟采用具有相关预测变量和混合数据类型(正态分布、指数分布、分类变量)的合成模型,在受控条件下测试算法的鲁棒性。
实验结果
研究问题
- RQ1特征相关性如何影响随机森林填补算法的准确度?
- RQ2在不同数据类型和缺失数据机制下,哪种随机森林填补方法在准确度方面表现最佳?
- RQ3在高缺失率和复杂缺失机制下,missForest 与其他随机森林填补方法相比表现如何?
- RQ4mForest 是否能在显著降低计算时间的同时,实现与 missForest 相当的准确度?
- RQ5在大规模数据场景下,填补准确度与计算效率之间存在何种权衡?
主要发现
- 所有基于随机森林的填补算法的填补准确度均随着特征相关性的提高而显著提升,即使在高缺失率和复杂缺失机制下亦然。
- missForest 始终保持最高的填补准确度,优于其他基于随机森林的方法以及 k-NN 和 MICE 等传统方法。
- mForest 相较于 missForest 实现了最高 10 倍的计算时间减少,且准确度损失微小,尤其在较大分组大小(α ≥ 0.1)时表现更优。
- 实时填补(OTFI)方法,特别是无监督随机森林填补,比 missForest 快 100 至 1000 倍,且填补性能稳定,适用于大规模数据。
- 随着缺失数据机制变得愈加复杂(从 MCAR 到 NMAR),性能系统性下降,但随机森林方法依然具有鲁棒性,尤其在高相关性条件下。
- 本研究证实,相关性是随机森林填补中的关键因素,更高的相关性使自适应最近邻机制能更有效地利用数据结构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。