[论文解读] GANDALF: Gated Adaptive Network for Deep Automated Learning of Features
GANDALF 提出了一种用于表格数据的新型深度学习架构,其核心为门控特征学习单元(GFLU),具备内置特征选择与可解释性,采用源自门控循环单元(GRUs)的新型门控机制,适用于非时序数据。该模型在多个基准测试中达到或超越当前最先进(SOTA)性能,同时具备参数效率与计算高效性,且几乎无需超参数调优。
We propose a novel high-performance, interpretable, and parameter \& computationally efficient deep learning architecture for tabular data, Gated Adaptive Network for Deep Automated Learning of Features (GANDALF). GANDALF relies on a new tabular processing unit with a gating mechanism and in-built feature selection called Gated Feature Learning Unit (GFLU) as a feature representation learning unit. We demonstrate that GANDALF outperforms or stays at-par with SOTA approaches like XGBoost, SAINT, FT-Transformers, etc. by experiments on multiple established public benchmarks. We have made available the code at github.com/manujosephv/pytorch_tabular under MIT License.
研究动机与目标
- 弥合深度学习与梯度提升决策树(GBDTs)在表格数据建模中的性能差距。
- 开发一种参数与计算效率高的深度学习架构,在保持高精度与可解释性的同时实现高性能。
- 引入一种新型表格数据处理单元,内置特征选择与稀疏性控制,以提升表征学习能力。
- 在多样化的公开基准数据集上评估模型,而非仅使用精心筛选的数据集,以确保泛化能力。
- 相比现有用于表格数据的深度学习模型,显著减少所需调优的超参数数量。
提出的方法
- 提出门控特征学习单元(GFLU),一种可学习、稀疏且可解释的处理单元,用于替代深度神经网络中处理表格数据的标准MLP。
- 引入一种源自门控循环单元(GRUs)的新型门控机制,适用于非时序表格数据,实现动态特征表征学习。
- 通过门控机制实现可学习的稀疏性,控制特征流动,减少噪声并提升模型效率。
- 采用α-entmax函数实现软特征掩码,实现可微分的特征选择,无需批归一化。
- 采用多阶段架构,每个GFLU阶段对特征进行逐步优化与稀疏化处理。
- 在多个公开基准上对GFLU阶段数、初始稀疏度、dropout与权重衰减等超参数进行调优。
实验结果
研究问题
- RQ1具备内置特征选择与可解释性的深度学习架构是否能在公开表格数据基准上超越或匹配SOTA的GBDT模型?
- RQ2源自GRUs的新型门控机制是否能提升非时序表格数据中的表征学习能力?
- RQ3与XGBoost、SAINT和FT-Transformers等模型相比,GANDALF在准确率、参数效率与推理速度方面表现如何?
- RQ4该模型在不同复杂度与特征类型的数据集上,性能是否保持稳健?
- RQ5与其它用于表格数据的深度学习模型相比,GANDALF所需调优的超参数数量有何差异?
主要发现
- GANDALF在18个公开基准上达到SOTA或具有竞争力的性能,仅经过5次随机超参数尝试后,在13个数据集中取得最佳结果。
- 在TabSurvey基准中,GANDALF在California Housing数据集上的测试均方误差(MSE)为0.160±0.006,优于XGBoost(0.206±0.005)与SAINT(0.226±0.004)。
- 在default-credit-card数据集上,GANDALF的测试误差为5.01×10⁻³,优于XGBoost(6.30×10⁻³)与FT-Transformer(3.98×10⁻³)。
- 特征消融实验表明,移除最相关特征会导致性能显著下降,其表现与XGBoost的特征重要性相当,证实了GANDALF具备可解释性与特征选择能力。
- 该模型在多样化数据集(包括yprop_4_1与Mercedes等高难度数据集)上表现出稳健性能,在极少调优下超越或匹配SOTA模型。
- GANDALF所需调优的超参数少于多数SOTA模型,仅需五个关键超参数:GFLU阶段数、初始稀疏度、GFLU Dropout、初始学习率与权重衰减。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。