[论文解读] Oblique Decision Trees from Derivatives of ReLU Networks
本文提出局部常数网络(LCNs),一种通过利用ReLU网络的局部常数梯度来隐式表示斜向决策树的神经架构。通过使用退火和DropConnect的梯度下降进行训练,LCNs在分子性质预测任务上实现了最先进性能,优于传统斜向决策树方法和标准树集成模型。
We show how neural models can be used to realize piece-wise constant functions such as decision trees. The proposed architecture, which we call locally constant networks, builds on ReLU networks that are piece-wise linear and hence their associated gradients with respect to the inputs are locally constant. We formally establish the equivalence between the classes of locally constant networks and decision trees. Moreover, we highlight several advantageous properties of locally constant networks, including how they realize decision trees with parameter sharing across branching / leaves. Indeed, only $M$ neurons suffice to implicitly model an oblique decision tree with $2^M$ leaf nodes. The neural representation also enables us to adopt many tools developed for deep networks (e.g., DropConnect (Wan et al., 2013)) while implicitly training decision trees. We demonstrate that our method outperforms alternative techniques for training oblique decision trees in the context of molecular property classification and regression tasks.
研究动机与目标
- 通过创建可微分的、基于神经网络的斜向决策树表示,弥合决策树的可解释性与深度学习的表征能力之间的差距。
- 通过将斜向决策树重新表述为基于梯度的神经架构,解决训练斜向决策树时固有的不可微分、组合优化挑战。
- 通过紧凑的神经表示实现在分支节点和叶节点之间的参数共享,降低树结构的显式复杂度。
- 在隐式训练树模型的同时,利用深度学习工具(如DropConnect和基于梯度的优化),以提升泛化能力和性能。
- 证明神经网络表示的决策树在表格数据和分子数据集上,能够超越经典树训练方法和标准集成模型。
提出的方法
- 核心思想是通过ReLU网络的局部常数梯度来表示分段常数函数(如决策树中的函数),而ReLU网络的梯度是分段线性的。
- 局部常数网络(LCN)被定义为ReLU网络相对于其输入的梯度,该梯度在神经网络的每个线性区域内保持恒定。
- 作者证明LCN类在数学上等价于斜向决策树类,建立了神经梯度与决策树结构之间的正式对应关系。
- 为实现基于梯度的训练,ReLU激活函数通过温度参数等方法平滑退火,以确保优化过程中的连续梯度。
- 开发了一种动态规划算法,可在单次前向传播中高效计算所有神经元相对于输入的梯度,从而克服关键计算瓶颈。
- 扩展包括Alcn(引入DropConnect以实现正则化)、Lln(切换激活函数)和Elcn(LCN的集成),进一步提升性能。
实验结果
研究问题
- RQ1ReLU网络的梯度能否隐式表示斜向决策树?该表示是否与标准决策树公式等价?
- RQ2如何通过可微分的神经架构缓解训练斜向决策树时的不可微分、组合优化问题?
- RQ3在神经表示中,决策节点和叶节点之间的参数共享在多大程度上减少了所需参数的数量,相比显式树结构?
- RQ4像DropConnect这样的深度学习正则化技术能否有效应用于隐式训练决策树?是否能提升泛化能力?
- RQ5所提出的决策树神经表示是否在分子性质预测任务上优于现有斜向树训练方法和标准树集成模型?
主要发现
- 所提出的局部常数网络(LCN)在分子性质分类和回归任务上实现了最先进性能,优于所有基线模型,包括CART、Hhcart、Tao、随机森林和梯度提升。
- 扩展模型Alcn(引入DropConnect)在LCN基础上持续提升泛化性能,证明了在隐式树学习背景下,随机权重丢弃的正则化优势。
- 基于多个LCN的集成方法Elcn在性能上与随机森林和梯度提升等标准树集成方法相当,尤其在深层树结构上表现出更强的泛化能力。
- 实证消融分析表明,无梯度退火的直接训练无法有效优化LCN,而结合退火与DropConnect则显著提升训练和测试性能。
- 在HIV数据集上,LCN的泛化能力显著优于竞争对手,且随着树深度增加性能持续提升——这归因于仅用M个神经元即可实现高达2^M个决策节点的指数级增长。
- 将训练好的LCN转换回显式的斜向决策树,可实现完全可解释性,既保留了经典决策树的透明性,又实现了深度学习级别的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。