[论文解读] Making Sense of Random Forest Probabilities: a Kernel Perspective
本文建立了一套基于核回归的随机森林概率估计框架,表明由树间接近度导出的接近度核可作为带宽参数。通过建模该核函数,作者为随机森林的概率估计提供了严谨的统计基础,并证明通过调节 mtry 可显著提升校准性能,基于接近度的方法在合成数据上的 RMSE 比标准随机森林降低高达 50%。
A random forest is a popular tool for estimating probabilities in machine learning classification tasks. However, the means by which this is accomplished is unprincipled: one simply counts the fraction of trees in a forest that vote for a certain class. In this paper, we forge a connection between random forests and kernel regression. This places random forest probability estimation on more sound statistical footing. As part of our investigation, we develop a model for the proximity kernel and relate it to the geometry and sparsity of the estimation problem. We also provide intuition and recommendations for tuning a random forest to improve its probability estimates.
研究动机与目标
- 为解决基于投票计数的随机森林概率估计缺乏统计基础的非原则性问题。
- 建立随机森林与核回归之间的正式联系,识别出接近度核作为其底层核函数。
- 对核函数的形状及其与 mtry 的带宽依赖关系进行建模,为调参提供直观理解。
- 通过从核视角重新诠释随机森林并提出基于接近度的估计方法,提升概率估计质量。
- 通过实证结果证明,基于接近度的随机森林在 RMSE 上显著优于标准分类或回归森林。
提出的方法
- 从随机森林结构中推导出接近度核,其中接近度衡量两个训练样本在各棵树中共同出现在同一叶节点的频率。
- 将接近度核建模为 mtry 的函数,表明其控制核估计的有效带宽。
- 将随机森林概率估计重新表述为使用接近度核的核回归,其中权重由与训练样本的接近度决定。
- 提出 $RF^{prox}$ 方法,使用接近度作为相似性度量进行概率估计,替代传统的投票计数。
- 通过调节 mtry 控制核带宽,平衡接近度核估计中的偏差与方差。
- 在合成数据集上,使用 RMSE 比较 $RF^{prox}$ 与标准随机森林(分类与回归模式)、袋装树以及完全随机森林的表现。
实验结果
研究问题
- RQ1如何将随机森林概率估计在核回归理论中实现形式化?
- RQ2mtry 在塑造接近度核以及控制概率估计中偏差-方差权衡方面发挥什么作用?
- RQ3接近度核如何与底层数据的几何结构和稀疏性相关联?
- RQ4基于接近度的概率估计能否优于随机森林中的标准投票计数方法?
- RQ5针对 mtry 的哪些调参策略能实现随机森林中概率校准的最优化?
主要发现
- 随机森林中的接近度核在核回归中充当带宽参数,其中 mtry 控制核的宽度,从而决定概率估计的平滑程度。
- 当 mtry = 1 时,即使分类误差达到最优,概率估计仍严重偏向 0.5,这是由于弱树和高相关性所致。
- 当 mtry = 30 时,概率估计能良好地集中在真实值(0.3 和 0.7)附近,表明调节 mtry 对校准至关重要。
- $RF^{prox}$ 方法在六种合成模型中的四种上实现了最低 RMSE,且在 XOR 和 1d 模型上相比最接近的竞争对手将误差降低了 50%。
- 在 10d 模型上,$RF^{prox}$ 的 RMSE 为 0.396,优于次优方法(0.383),显示出在高维设置下的鲁棒性。
- 核视角揭示,即使标准随机森林达到了贝叶斯误差率,其概率估计仍可能表现不佳,凸显了分类性能与概率性能之间的脱节。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。