[论文解读] When are Deep Networks really better than Decision Forests at small sample sizes, and how?
本文研究了在小样本量下深度神经网络(DNNs)何时优于决策森林(DFs),将两者均视为将特征空间划分为凸多面体并基于激活节点投票进行分类的“划分与投票”机制。研究发现,对于表格、视觉和听觉数据,在样本量≤10,000时,决策森林始终优于深度神经网络,尤其在低数据环境下,这归因于其对有限数据的鲁棒性以及更简单的归纳偏置;而深度神经网络仅在数据量增大时表现更优,表明混合模型可能带来进一步提升。
Deep networks and decision forests (such as random forests and gradient boosted trees) are the leading machine learning methods for structured and tabular data, respectively. Many papers have empirically compared large numbers of classifiers on one or two different domains (e.g., on 100 different tabular data settings). However, a careful conceptual and empirical comparison of these two strategies using the most contemporary best practices has yet to be performed. Conceptually, we illustrate that both can be profitably viewed as "partition and vote" schemes. Specifically, the representation space that they both learn is a partitioning of feature space into a union of convex polytopes. For inference, each decides on the basis of votes from the activated nodes. This formulation allows for a unified basic understanding of the relationship between these methods. Empirically, we compare these two strategies on hundreds of tabular data settings, as well as several vision and auditory settings. Our focus is on datasets with at most 10,000 samples, which represent a large fraction of scientific and biomedical datasets. In general, we found forests to excel at tabular and structured data (vision and audition) with small sample sizes, whereas deep nets performed better on structured data with larger sample sizes. This suggests that further gains in both scenarios may be realized via further combining aspects of forests and networks. We will continue revising this technical report in the coming months with updated results.
研究动机与目标
- 确定在训练数据有限(≤10,000个样本)的情况下,深度网络在何种条件下优于决策森林,这一情形在生物医学和科学数据集中十分常见。
- 通过将深度网络与决策森林统一为“划分与投票”机制,即在特征空间中划分为凸多面体,并通过激活区域的投票进行分类,从而实现对两者概念上的统一理解。
- 在不同样本量下,对表格、视觉和听觉数据中的两种方法进行实证基准测试,重点关注小样本性能。
- 识别出每种方法表现优异的条件,特别是特征位置与数据量的作用,并为未来混合模型设计提供指导。
- 为整合两种模型的洞察提供基础,可能为机器学习和神经科学领域关于生物学习机制的研究提供启示。
提出的方法
- 本文将深度网络与决策森林均概念化为“划分与投票”模型:它们将输入特征空间划分为凸多面体的并集,并通过聚合激活节点或区域的投票进行分类。
- 以Stone定理的普遍一致性理论为基础,证明当数据量增加、划分趋于精细时,两种方法在温和条件下均能收敛至最优分类。
- 在三种数据模态上开展实证评估:表格数据(如生物医学数据)、视觉数据(图像)和听觉数据(频谱图),样本量范围为每类10至10,000个样本。
- 对于视觉和听觉数据,模型在原始特征和频谱图上进行训练;为满足输入要求,将ResNet-18适配用于音频任务时通过复制通道实现。
- 所有模型保持一致的超参数设置,性能通过保留测试集(10%数据)上的分类准确率进行评估。
- 基准测试在标准化硬件(6核CPU,1核GPU)上进行,以确保模型比较的可复现性与公平性。
实验结果
研究问题
- RQ1在何种数据与模型条件下,深度网络在小样本量下优于决策森林?
- RQ2当将深度网络与决策森林视为划分与投票机制时,其内部表征有何异同?
- RQ3为何决策森林在表格、视觉和听觉任务的低数据环境中始终优于深度网络?
- RQ4空间或位置特征信息的引入在多大程度上影响了两种方法之间的性能差距?
- RQ5两者作为“划分与投票”系统的概念相似性,能否为设计更鲁棒的混合机器学习架构提供启示?
主要发现
- 在样本量较小(≤10,000)时,决策森林在表格、视觉和听觉数据上均优于深度神经网络,尤其在每类仅10个样本的3类和8类音频分类任务中表现更优。
- 在8类音频分类任务中,随机森林在所有样本量下均取得最高准确率,而ResNet-18-Audio表现最差,可能由于模型复杂度过高且数据不足导致过拟合。
- 在3类任务中,较简单的卷积网络(1层和5层CNN)与随机森林性能相当,但在更复杂的8类设置中,森林仍占据优势。
- 随着类别数量增加,森林与深度网络之间的性能差距扩大;随着样本量增加,差距缩小,表明森林在低数据环境下更具鲁棒性。
- 使用频谱图和梅尔频率倒谱系数(MFCCs)的结果与原始图像结果定性相似,森林在小样本设置中始终优于深度网络。
- 将两种模型统一为“划分与投票”系统,为理解其行为机制和潜在整合提供了共享框架。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。