[论文解读] Revisiting Pretraining Objectives for Tabular Deep Learning
本文研究了表格深度学习模型的预训练目标,表明目标感知预训练——尤其是使用目标标签进行预训练——能显著提升下游性能。研究发现自预测和对比学习目标具有竞争力,且预训练甚至能使简单的MLP模型在完全标注的数据集上达到或超越当前最优的GBDT模型表现。
Recent deep learning models for tabular data currently compete with the traditional ML models based on decision trees (GBDT). Unlike GBDT, deep models can additionally benefit from pretraining, which is a workhorse of DL for vision and NLP. For tabular problems, several pretraining methods were proposed, but it is not entirely clear if pretraining provides consistent noticeable improvements and what method should be used, since the methods are often not compared to each other or comparison is limited to the simplest MLP architectures. In this work, we aim to identify the best practices to pretrain tabular DL models that can be universally applied to different datasets and architectures. Among our findings, we show that using the object target labels during the pretraining stage is beneficial for the downstream performance and advocate several target-aware pretraining objectives. Overall, our experiments demonstrate that properly performed pretraining significantly increases the performance of tabular DL models, which often leads to their superiority over GBDTs.
研究动机与目标
- 识别适用于表格深度学习的有效预训练目标,确保在多种数据集和模型架构上持续提升性能。
- 评估在标签数据丰富的完全监督表格学习设置中,预训练是否能带来可测量的性能增益。
- 比较多种预训练目标(自预测、对比学习、自编码及目标感知变体)在简单与先进架构上的表现。
- 建立预训练表格模型的最佳实践,包括模型架构选择与训练流程。
- 评估集成预训练模型的影响,以及在预训练过程中标签信息的作用。
提出的方法
- 直接在下游目标数据集上进行预训练,使用全部标注数据,以模拟真实工业场景。
- 提出并评估多种预训练目标:自预测(如掩码并重建特征)、对比学习(通过数据增强实现)和自编码(重建损失)。
- 引入在预训练过程中融入目标标签的目标感知方法,例如基于目标条件预测掩码特征,或在预训练中使用目标采样。
- 同时采用标准MLP和先进的基于嵌入的架构(如[14]中的模型),以评估在不同模型类型上的泛化能力。
- 采用标准评估协议:在完整数据集上预训练,随后在下游任务上使用标准训练/验证/测试划分进行微调。
- 对预训练模型进行集成,以评估模型多样性与性能增益。
实验结果
研究问题
- RQ1在完全监督的设置下,预训练是否能为表格深度学习模型带来一致的性能提升?
- RQ2在表格数据上,自预测、对比学习和自编码等不同预训练目标的性能表现如何比较?
- RQ3在预训练过程中引入目标标签,是否能带来优于无监督目标的下游性能?
- RQ4预训练是否特别有利于简单架构(如MLP),还是增益仅限于复杂模型?
- RQ5集成预训练模型是否有效,且是否在共享初始化下仍能保持模型多样性?
主要发现
- 在完全标注的表格数据集中,预训练显著优于经过充分调优的监督基线模型,通常超越GBDT模型表现。
- 基于自预测的目标(如掩码特征预测)表现与对比学习相当,这一发现此前在表格深度学习中尚未报道。
- 目标感知预训练目标(如掩码+目标或重建+目标)始终优于其无监督对应方法,证明了在预训练中使用标签信息的价值。
- 预训练带来的性能增益在简单MLP架构上最为显著,预训练使其达到与从零开始训练的最先进模型相当的水平。
- 集成预训练模型可进一步提升性能,表明预训练并未过度限制模型多样性。
- 表现最佳的设置(掩码+目标)在HIGGS数据集上实现了0.975 ± 2.8e-4的测试AUC,优于监督基线和其他预训练变体。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。