Skip to main content
QUICK REVIEW

[论文解读] Random Hinge Forest for Differentiable Learning

Nathan Lay, Adam P. Harrison|arXiv (Cornell University)|Feb 12, 2018
Anomaly Detection Techniques and Applications参考文献 13被引用 8
一句话总结

本文提出随机铰链森林(RHF),一种可微分决策森林变体,可在计算图中通过随机梯度下降实现端到端训练。RHF 在性能上与神经决策森林等最先进模型相当,同时参数量显著更少,并支持高效的对数时间梯度计算。

ABSTRACT

We propose random hinge forests, a simple, efficient, and novel variant of decision forests. Importantly, random hinge forests can be readily incorporated as a general component within arbitrary computation graphs that are optimized end-to-end with stochastic gradient descent or variants thereof. We derive random hinge forest and ferns, focusing on their sparse and efficient nature, their min-max margin property, strategies to initialize them for arbitrary network architectures, and the class of optimizers most suitable for optimizing random hinge forest. The performance and versatility of random hinge forests are demonstrated by experiments incorporating a variety of of small and large UCI machine learning data sets and also ones involving the MNIST, Letter, and USPS image datasets. We compare random hinge forests with random forests and the more recent backpropagating deep neural decision forests.

研究动机与目标

  • 为克服传统随机森林无法端到端训练且依赖固定特征的局限性。
  • 开发一种可微分决策森林,可无缝集成到任意计算图中,实现与其他可学习组件的联合优化。
  • 通过确保数值稳定性、对数时间梯度复杂度以及对参数初始化的鲁棒性,改进现有可微分决策森林。
  • 证明 RHF 在表格数据(UCI)和图像数据(MNIST、USPS、Letter)上均能达到具有竞争力的性能,且参数量远少于最先进方法。

提出的方法

  • RHF 使用分段线性铰链函数作为决策边界,通过平滑近似实现树结构中可微分的路径遍历。
  • 森林中的每棵树均通过随机化、可学习的特征投影构建,使模型能够自适应地学习有用的特征组合。
  • 由于采用稀疏、基于路径的反向传播,RHF 的梯度计算复杂度为对数级别,避免了先前方法的指数级开销。
  • 模型采用最小-最大边缘属性以稳定训练过程,降低对激活函数饱和或精度损失的敏感性。
  • 提出了初始化策略,使 RHF 可适应任意网络架构,包括图像任务中的卷积特征图。
  • 由于其高效的非概率叶节点预测机制,RHF 支持小批量训练,而无需像某些模型那样依赖大直方图以保证稳定性。

实验结果

研究问题

  • RQ1能否在计算图中通过随机梯度下降高效实现可微分决策森林的端到端训练?
  • RQ2RHF 在标准基准数据集上的性能与随机森林和神经决策森林相比如何?
  • RQ3参数效率与训练速度对 RHF 的可扩展性与实际部署有何影响?
  • RQ4尽管采用分段线性决策边界,RHF 是否仍能良好泛化,尤其是在与基于 Sigmoid 的非线性决策森林相比时?

主要发现

  • 在 MNIST 和 USPS 数据集上,RHF 性能与神经决策森林相当,在 Letter 数据集上排名第二,优于随机森林。
  • 在 MNIST 数据集上,RHF 所用参数量约为神经决策森林的 1/17,同时保持了具有竞争力的准确率。
  • RHF 能够有效使用小批量训练(如 MNIST 的 1000 个样本),而神经决策森林则需大批次以保证直方图稳定性。
  • RHF 的梯度计算复杂度随树深度对数增长,即使在大型森林(如 1000 棵深度为 10 的树)上也能实现快速训练(CPU 上)。
  • 在 Madelon 数据集上,RHF 表现较差,原因在于内积特征表现不佳,表明当可学习特征未被稀疏选择时存在局限性。
  • RHF 的蕨类变体(fern variant)在参数量约为原 RHF 一半的情况下实现了相近性能,证明了其极高的参数效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。