[论文解读] The GatedTabTransformer. An enhanced deep learning architecture for tabular modeling
本文提出 GatedTabTransformer,一种用于表格数据的增强深度学习架构,通过用门控 MLP(gMLP)块替换 TabTransformer 中的标准 MLP 头部,以提升性能。通过引入线性投影和空间门控单元,该模型在三个二分类数据集上的 AUROC 提升 0.5% 至 1.1%,相较于基线模型最高提升达 3.1%。
There is an increasing interest in the application of deep learning architectures to tabular data. One of the state-of-the-art solutions is TabTransformer which incorporates an attention mechanism to better track relationships between categorical features and then makes use of a standard MLP to output its final logits. In this paper we propose multiple modifications to the original TabTransformer performing better on binary classification tasks for three separate datasets with more than 1% AUROC gains. Inspired by gated MLP, linear projections are implemented in the MLP block and multiple activation functions are tested. We also evaluate the importance of specific hyper parameters during training.
研究动机与目标
- 提升 TabTransformer 在表格数据二分类任务上的性能。
- 探究将标准 MLP 头部替换为门控 MLP(gMLP)是否能改善泛化能力和特征表示。
- 优化学习率、隐藏维度和激活函数等关键超参数,以实现更好的模型收敛与性能。
- 评估架构修改对模型在多样化表格数据集上鲁棒性与可扩展性的影响。
提出的方法
- 用使用空间门控单元实现跨标记交互的门控 MLP(gMLP)块,替换 TabTransformer 中的最终多层感知机(MLP)头部。
- 在 gMLP 块中沿通道维度引入线性投影(U 和 V),以增强特征转换能力。
- 使用空间门控单元 s(Z) = Z * f_{W,b}(Z),其中 f_{W,b}(Z) = WZ + b,实现可学习的、通道相关的注意力机制。
- 应用 ReLU 激活函数,并将权重初始化为接近零的值,偏置初始化为 1,以稳定训练过程。
- 通过系统性消融实验,优化学习率、gMLP 和 Transformer 堆叠的隐藏维度大小及深度等超参数。
- 在将数据输入 gMLP 头部进行最终预测前,将归一化的连续特征与列嵌入的分类特征进行拼接。
实验结果
研究问题
- RQ1在 TabTransformer 中用门控 MLP(gMLP)替换标准 MLP 头部,是否能提升表格数据二分类任务的性能?
- RQ2不同激活函数(ReLU、GELU、SELU、LeakyReLU)对最终分类头部性能有何影响?
- RQ3在 AUROC 性能与模型可扩展性方面,gMLP 块的最佳隐藏维度大小是多少?
- RQ4学习率调度如何影响 GatedTabTransformer 架构的收敛性与最终 AUROC?
- RQ5与原始 TabTransformer 相比,架构修改(如线性投影和空间门控)在多大程度上提升了泛化能力?
主要发现
- 在 bank_marketing 数据集上,GatedTabTransformer 相较于原始 TabTransformer 实现了平均 1.0% 的 AUROC 提升。
- 在 1995_income 数据集上,该模型相比 TabTransformer 提升了 0.7% 的 AUROC,相比基线 MLP 提升达 2.5%。
- 在 blastchar 数据集上,相比 TabTransformer 提升 0.5% 的 AUROC,相比 MLP 提升 1.6%,表明在多样化表格数据上具有稳定的性能增益。
- 在更深的架构中,gMLP 块优于标准 MLP,其性能随隐藏维度增大而持续提升,而标准 MLP 则趋于饱和。
- LeakyReLU 在负斜率值介于 0.01 至 0.05 时与标准 ReLU 表现最佳,最终选择 ReLU 以保证简洁性与一致性。
- 超参数调优表明,将隐藏维度大小提升至 32 以上可持续改善 gMLP 性能,而标准 MLP 则表现出收益递减。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。