[论文解读] DNF-Net: A Neural Architecture for Tabular Data
DNF-Net 是一种用于表格数据的新型神经网络架构,通过仿射软阈值特征上的析取范式(DNF)来建模决策,引入了特征选择和空间定位的归纳偏置。它在表格基准测试中持续优于全连接网络(FCNs),在某些情况下可与 XGBoost 比较甚至超越,支持使用 SGD 进行端到端训练。
A challenging open question in deep learning is how to handle tabular data. Unlike domains such as image and natural language processing, where deep architectures prevail, there is still no widely accepted neural architecture that dominates tabular data. As a step toward bridging this gap, we present DNF-Net a novel generic architecture whose inductive bias elicits models whose structure corresponds to logical Boolean formulas in disjunctive normal form (DNF) over affine soft-threshold decision terms. In addition, DNF-Net promotes localized decisions that are taken over small subsets of the features. We present an extensive empirical study showing that DNF-Nets significantly and consistently outperform FCNs over tabular data. With relatively few hyperparameters, DNF-Nets open the door to practical end-to-end handling of tabular data using neural networks. We present ablation studies, which justify the design choices of DNF-Net including the three inductive bias elements, namely, Boolean formulation, locality, and feature selection.
研究动机与目标
- 为解决表格数据缺乏广泛接受的神经网络架构的问题,该领域目前仍由梯度提升决策树(GBDTs)主导。
- 设计一种具有归纳偏置的神经网络,以模拟决策森林的关键特性:逻辑结构(DNF)、特征选择和局部化决策。
- 实现使用标准 SGD 对表格数据的神经网络模型进行端到端训练,克服 GBDTs 在可扩展性和多模态融合方面的局限。
- 通过实证验证,DNF 结构、特征选择和定位的结合是否能提升标准全连接网络的性能。
提出的方法
- 核心组件是 DNNF 模块——一个两层隐藏的前馈网络,用于学习仿射软阈值字面量,并通过析取(逻辑或)结构组合形成类似 DNF 的逻辑公式。
- 通过可学习的软掩码对输入特征进行特征选择,实现每个决策项对相关特征的动态、可微选择。
- 通过空间受限的注意力或路由机制实现定位,使每个决策项仅作用于特征的小范围局部子集。
- 使用 Sigmoid 激活函数建模软阈值,支持所有组件的端到端反向传播联合优化。
- 使用标准随机梯度下降(SGD)进行训练,实现完全可微分,并可扩展至大规模数据集。
- 通过消融研究分离评估每种归纳偏置的贡献:DNF 结构、特征选择和定位。
实验结果
研究问题
- RQ1具有析取范式(DNF)归纳偏置的神经网络架构是否能在表格数据上超越全连接网络?
- RQ2引入可学习的特征选择和局部化决策是否能提升表格预测任务的性能?
- RQ3DNF-Net 在标准表格基准测试中能在多大程度上匹配或超越梯度提升决策树(GBDTs)如 XGBoost 的性能?
- RQ4DNF 结构、特征选择和定位这三个独立组件对模型性能的贡献分别是什么?
- RQ5DNF-Net 是否能在包括高维和合成数据在内的多样化表格数据集上实现泛化?
主要发现
- DNF-Net 在多个真实世界的表格数据集上持续优于全连接网络(FCNs),证明了其归纳偏置的有效性。
- 消融研究证实,三种归纳偏置——DNF 结构、特征选择和定位——均不可或缺,且各自对性能有显著贡献。
- 在合成数据集上,DNF-Net 在不同输入维度下均保持高准确率,表现出对数据复杂性的鲁棒性。
- 在两项过往的 Kaggle 竞赛中,DNF-Net 的性能与 XGBoost 相当,仅在部分数据集上略有逊色。
- 特征选择机制可独立提升模型性能和泛化能力,经由受控的合成实验验证。
- DNF-Net 支持使用 SGD 进行端到端训练,为 GBDTs 提供了一种可扩展的替代方案,且可轻松集成到更大的神经网络流水线中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。