[论文解读] Transfer Learning with Deep Tabular Models
该论文表明,在低数据量的医疗诊断场景中,使用深度表格模型进行迁移学习显著优于梯度提升决策树(GBDTs)。通过利用监督预训练以及一种新颖的伪特征方法来处理特征集不匹配问题,该方法在下游数据稀缺时实现了最先进性能。
Recent work on deep learning for tabular data demonstrates the strong performance of deep tabular models, often bridging the gap between gradient boosted decision trees and neural networks. Accuracy aside, a major advantage of neural models is that they learn reusable features and are easily fine-tuned in new domains. This property is often exploited in computer vision and natural language applications, where transfer learning is indispensable when task-specific training data is scarce. In this work, we demonstrate that upstream data gives tabular neural networks a decisive advantage over widely used GBDT models. We propose a realistic medical diagnosis benchmark for tabular transfer learning, and we present a how-to guide for using upstream data to boost performance with a variety of tabular neural network architectures. Finally, we propose a pseudo-feature method for cases where the upstream and downstream feature sets differ, a tabular-specific problem widespread in real-world applications. Our code is available at https://github.com/LevinRoman/tabular-transfer-learning .
研究动机与目标
- 解决表格机器学习中标签数据有限的挑战,特别是在数据收集成本高昂的医疗应用中。
- 探究深度表格模型是否能像传统GBDT方法不同地在任务间有效迁移知识。
- 为现实世界问题(如上游与下游数据集之间的特征集不匹配)开发实用解决方案。
- 比较表格迁移学习中监督预训练与自监督预训练策略,以确定哪种方法能生成更具迁移性的表征。
提出的方法
- 在大型上游表格数据集上预训练深度表格模型(如FT-Transformer、TabMLP),以学习可泛化的表征。
- 在下游任务中使用有限的标注数据微调预训练模型,以实现知识迁移。
- 提出一种伪特征方法:在缺少下游特征的上游数据上进行预训练,然后利用模型预测上游数据中缺失的特征,再进行重新预训练并完成迁移。
- 实施监督预训练与自监督预训练策略,以比较其在表格设置中的可迁移性。
- 使用MetaMIMIC仓库构建具有不同数据可用性的现实医疗诊断基准任务。
- 采用端到端训练方式,结合可学习头(线性或MLP),在迁移后优化下游性能。
实验结果
研究问题
- RQ1当下游数据有限时,使用迁移学习的深度表格模型是否能超越强基线GBDT模型?
- RQ2在表格领域,监督预训练是否比自监督预训练产生更具迁移性的表征?
- RQ3所提出的伪特征方法在处理上游与下游数据集之间特征集不匹配问题时效果如何?
- RQ4预训练策略(监督 vs. 自监督)对低数据设置下的下游性能有何影响?
- RQ5使用深度表格模型的迁移学习是否能在仅用极少标注样本的情况下,有效泛化到多样化的医疗诊断任务中?
主要发现
- 即使在使用堆叠方法利用上游数据的GBDT基线模型中,使用迁移学习的深度表格模型也始终表现更优,尤其在下游数据有限时。
- 与计算机视觉领域的趋势相反,在表格数据中,监督预训练比自监督预训练产生更具迁移性的特征。
- 所提出的伪特征方法在性能上可与使用缺失特征真实值预训练的模型相媲美,显著优于丢弃缺失特征的方法。
- 在MetaMIMIC医疗诊断基准上,使用FT-Transformer的迁移学习在'Alcohol'任务中达到0.878的ROC-AUC,在'Purpura'任务中达到0.836,且下游数据有限。
- 即使仅使用1%的下游数据,使用深度表格模型的迁移学习在'Alcohol'任务中也达到了0.692的AUC,优于XGBoost+堆叠(0.692)和CatBoost+堆叠(0.692),表明其在低数据场景下的鲁棒性。
- 在某些情况下,与丢弃缺失特征的方法相比,伪特征方法使性能提升最高达0.05 AUC,验证了其在真实场景中的实际效用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。