Skip to main content
QUICK REVIEW

[论文解读] Fast, Accurate, and Simple Models for Tabular Data via Augmented Distillation

Rasool Fakoor, Jonas Mueller|arXiv (Cornell University)|Jun 25, 2020
Machine Learning and Data Classification参考文献 57被引用 14
一句话总结

本文提出FAST-DAD,一种与模型无关的知识蒸馏框架,通过基于自注意力机制的伪似然估计器对数据进行吉布斯采样,实现对表格数据训练数据的增强,从而提升学生模型的性能。该方法生成的个体模型在30个回归与分类任务的数据集上达到SOTA性能,其推理速度比AutoML集成模型快10倍以上,且准确率更高。

ABSTRACT

Automated machine learning (AutoML) can produce complex model ensembles by stacking, bagging, and boosting many individual models like trees, deep networks, and nearest neighbor estimators. While highly accurate, the resulting predictors are large, slow, and opaque as compared to their constituents. To improve the deployment of AutoML on tabular data, we propose FAST-DAD to distill arbitrarily complex ensemble predictors into individual models like boosted trees, random forests, and deep networks. At the heart of our approach is a data augmentation strategy based on Gibbs sampling from a self-attention pseudolikelihood estimator. Across 30 datasets spanning regression and binary/multiclass classification tasks, FAST-DAD distillation produces significantly better individual models than one obtains through standard training on the original data. Our individual distilled models are over 10x faster and more accurate than ensemble predictors produced by AutoML tools like H2O/AutoSklearn.

研究动机与目标

  • 解决AutoML在表格数据设置下生成的集成模型效率低下且不透明的问题。
  • 通过利用未标注数据增强扩大有效训练数据规模,减少知识蒸馏中常见的性能下降。
  • 开发一种与模型无关的知识蒸馏方法,适用于多种学生模型(如提升树、随机森林、深度网络)和多种预测任务(回归、二分类/多分类)。
  • 在典型表格数据集的低数据量场景下,实现高效且高精度的知识蒸馏,此类场景中数据增强尚未得到充分探索。
  • 建立一个全面的表格数据知识蒸馏基准,评估多种策略与学生模型架构。

提出的方法

  • 该方法使用基于自注意力机制的伪似然模型估计特征的条件分布,从而在无需完整密度估计的情况下近似联合分布。
  • 通过吉布斯采样从伪似然模型中生成多样化且高质量的未标注数据,其中每一步采样均以其他特征为条件重新采样一个特征。
  • 将原始标注数据与吉布斯采样生成的未标注数据合并,形成增强数据集,用于训练学生模型,从而提升泛化能力并降低方差。
  • 每条数据点的吉布斯采样步数经过优化,以在样本质量与计算成本之间取得平衡,实证结果表明1–5轮为最优选择。
  • 该方法具有与模型无关的特性,可实现从任意教师集成模型(如AutoGluon)到任意学生模型(如XGBoost、ResNet)的知识蒸馏。
  • 理论分析将学生模型的泛化误差与真实数据分布和吉布斯采样分布之间的总变差距离建立关联。

实验结果

研究问题

  • RQ1通过伪似然模型进行吉布斯采样实现的数据增强,能否显著提升表格数据中蒸馏个体模型的准确性?
  • RQ2在蒸馏数据中引入自采样的未标注样本,能否缩小蒸馏模型与复杂AutoML集成模型之间的性能差距?
  • RQ3吉布斯采样步数对蒸馏模型性能与效率有何影响?
  • RQ4与特定任务的蒸馏技术相比,与模型无关的蒸馏框架是否能在表格学习中表现更优?
  • RQ5在增强数据中,样本质量与多样性之间是否存在可调控的权衡,从而优化学生模型性能?

主要发现

  • FAST-DAD在30个表格数据集上生成的个体学生模型,其推理速度比H2O-AutoML和AutoSklearn的集成预测器快10倍以上,且准确率更高。
  • 该方法在保持或超越AutoGluon完整集成模型测试准确率的同时,实现了10,000倍的推理速度提升。
  • 仅使用1–5轮吉布斯采样即优于更长的采样链,表明在样本质量与计算成本之间达到了最优平衡。
  • 通过增强蒸馏数据,该方法在不增加额外标注样本的前提下,通过扩大有效训练数据规模,降低了学生模型的泛化误差。
  • 自注意力伪似然模型能够准确估计条件分布,为低数据量表格场景下的有效数据增强提供了基础。
  • 全面的基准测试表明,FAST-DAD在全部30个数据集和4种学生模型类型上,均优于标准蒸馏方法及其他数据增强策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。