Skip to main content
QUICK REVIEW

[论文解读] Getting Better from Worse: Augmented Bagging and a Cautionary Tale of Variable Importance

Lucas Mentch, Siyu Zhou|arXiv (Cornell University)|Mar 7, 2020
Gaussian Processes and Bayesian Inference参考文献 51被引用 16
一句话总结

本文提出了一种新型的袋装方法——AugBagg,通过在原始特征空间中引入条件独立的噪声特征来提升预测准确性。令人惊讶的是,这种简单的增强方法常常优于经过最优调优的随机森林模型,挑战了关于变量重要性的传统认知,并揭示了噪声特征可提升模型性能,从而削弱了基于预测增益的标准重要性度量方法的可靠性。

ABSTRACT

As the size, complexity, and availability of data continues to grow, scientists are increasingly relying upon black-box learning algorithms that can often provide accurate predictions with minimal a priori model specifications. Tools like random forests have an established track record of off-the-shelf success and even offer various strategies for analyzing the underlying relationships among variables. Here, motivated by recent insights into random forest behavior, we introduce the simple idea of augmented bagging (AugBagg), a procedure that operates in an identical fashion to classical bagging and random forests, but which operates on a larger, augmented space containing additional randomly generated noise features. Surprisingly, we demonstrate that this simple act of including extra noise variables in the model can lead to dramatic improvements in out-of-sample predictive accuracy, sometimes outperforming even an optimally tuned traditional random forest. As a result, intuitive notions of variable importance based on improved model accuracy may be deeply flawed, as even purely random noise can routinely register as statistically significant. Numerous demonstrations on both real and synthetic data are provided along with a proposed solution.

研究动机与目标

  • 研究在袋装和随机森林模型中向训练数据添加噪声特征是否能提升预测性能。
  • 挑战基于预测提升的变量重要性度量方法的有效性,尤其是在噪声特征表现出显著重要性时。
  • 提出一种受正则化启发的新方法——AugBagg,通过刻意的特征空间增强来提升模型准确性。
  • 证明在预测建模背景下,仅使用信号特征为最优的既定假设可能存在缺陷。

提出的方法

  • AugBagg 通过在模型拟合前向原始特征空间添加一组独立的噪声特征,扩展了经典袋装方法。
  • 这些噪声特征与响应变量条件独立,确保其不携带任何真实预测信号。
  • 该方法使用标准的自助抽样和集成平均方法,与袋装和随机森林相同,但作用于增强后的特征集。
  • 通过在多种具有不同信噪比的真实和合成数据集上评估样本外预测准确性来衡量性能。
  • 使用基于置换的方法评估变量重要性,比较包含和不包含特定特征的模型。
  • 将该方法与经过最优超参数调优的标准随机森林进行比较,以评估相对性能。

实验结果

研究问题

  • RQ1在袋装和随机森林模型中,添加条件独立的噪声特征是否能显著提升样本外预测准确性?
  • RQ2噪声特征在标准变量重要性度量中在多大程度上被标记为‘重要’,这是否削弱了此类度量的可靠性?
  • RQ3噪声增强带来的性能提升是否依赖于底层数据的信噪比?
  • RQ4在多种数据集上,AugBagg 与最优调优的随机森林在预测准确性方面相比如何?
  • RQ5观察到的性能提升是否可归因于隐式正则化?如果是,这种正则化与显式正则化技术(如岭回归)相比有何异同?

主要发现

  • AugBagg 在多个数据集上持续提升了样本外预测准确性,其表现常常超过经过最优调优的随机森林。
  • 性能提升在信噪比较低的场景下最为显著,此时噪声特征有助于稳定模型学习。
  • 即使完全是随机的噪声特征,也可能在标准变量重要性度量中被标记为高度重要,尽管其与响应变量之间既无因果关系也无预测关系。
  • 在信噪比较高的情况下,引入相关噪声特征可进一步提升性能,表明存在更广泛的正则化效应。
  • 基于预测提升的标准变量重要性度量存在根本性缺陷,因为当噪声特征提升准确性时,这些度量无法区分信号与噪声。
  • 结果表明,‘预测提升’并非特征必要性的可靠代理指标,因此可能需要采用类似 knockoffs 的方法来准确评估特征重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。