Skip to main content
QUICK REVIEW

[论文解读] CO2 Forest: Improved Random Forest by Continuous Optimization of Oblique Splits

Mohammad Norouzi, Maxwell D. Collins|arXiv (Cornell University)|Jun 19, 2015
Neural Networks and Applications参考文献 24被引用 5
一句话总结

CO2 Forest 提出了一种新颖的随机森林算法,通过使用凸-凹上界对分类损失进行连续优化,实现对斜向决策树分裂(即特征的线性组合)的优化,从而支持高效的随机梯度下降。该方法在多分类基准和 LFW 人脸分割任务中显著优于标准随机森林及以往的斜向树方法,在最多 1000 棵树的情况下实现了最先进性能。

ABSTRACT

We propose a novel algorithm for optimizing multivariate linear threshold functions as split functions of decision trees to create improved Random Forest classifiers. Standard tree induction methods resort to sampling and exhaustive search to find good univariate split functions. In contrast, our method computes a linear combination of the features at each node, and optimizes the parameters of the linear combination (oblique) split functions by adopting a variant of latent variable SVM formulation. We develop a convex-concave upper bound on the classification loss for a one-level decision tree, and optimize the bound by stochastic gradient descent at each internal node of the tree. Forests of up to 1000 Continuously Optimized Oblique (CO2) decision trees are created, which significantly outperform Random Forest with univariate splits and previous techniques for constructing oblique trees. Experimental results are reported on multi-class classification benchmarks and on Labeled Faces in the Wild (LFW) dataset.

研究动机与目标

  • 为解决标准随机森林中单变量分裂的局限性,尽管计算效率高,但其判别能力受限。
  • 克服传统分裂准则(如基尼系数、信息增益)的不可微性和不连续性,这些特性阻碍了对斜向分裂的数值优化。
  • 构建一种连续且可微的代理损失函数,以实现对决策树中多变量线性阈值函数的有效优化。
  • 在优化过程中保持树集成的多样性,确保在随机森林设置下具备鲁棒的泛化能力。
  • 将斜向树学习扩展至计算机视觉和机器学习中常见的高维、大规模数据集。

提出的方法

  • 使用类似阶梯函数的损失函数,为单层决策树的实证分类损失构建连续上界。
  • 将分裂函数建模为特征的线性组合(即斜向分裂),并通过随机梯度下降优化其参数。
  • 利用凸-凸过程(CCCP)优化上界的差-凸(DC)分解。
  • 通过从随机森林中初始化分裂函数,以促进多样性并避免陷入局部极小值。
  • 独立优化最多 1000 棵 CO2 树,每棵树均基于连续上界和 SGD 训练。
  • 通过在上界中使用任意凸损失函数,将该框架推广至多分类、回归和结构化预测任务。

实验结果

研究问题

  • RQ1能否为斜向决策树分裂优化的不连续目标构建一种连续且可微的代理损失?
  • RQ2在高维特征空间中,斜向分裂的连续优化是否能带来优于穷举搜索或随机采样的泛化性能?
  • RQ3在随机森林框架中,经优化的斜向树能否保持足够的多样性以形成有效的集成?
  • RQ4在大规模、高维数据集上,CO2 Forest 与标准随机森林及 OC1 相比,在准确率和可扩展性方面表现如何?
  • RQ5该方法是否能在无需复杂特征工程的情况下,在真实世界视觉任务(如人脸部件分割)中实现最先进性能?

主要发现

  • CO2 Forest 在所有九个测试的多分类基准上均优于标准随机森林,且准确率提升稳定。
  • 在 Labeled Faces in the Wild(LFW)数据集上,CO2 Forest 使用 32 棵树时测试 Jaccard 得分为 42.55,显著优于随机森林(34.61)和 Two-probe Forest(38.61)。
  • 使用 16 棵树时,CO2 Forest 在验证集上达到 41.87 的 Jaccard 得分,超参数 η=10⁻⁴ 和 ν=1 通过网格搜索选定。
  • 该方法能有效处理高维输入(如 2883 维图像窗口)和大规模训练集(256,000 个子窗口)。
  • 随着树数量的增加,CO2 Forest 保持强劲性能,表明在从随机森林初始化的前提下,优化不会损害集成多样性。
  • 由于上界中使用了通用凸损失,该框架可推广至其他任务,包括回归和结构化预测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。