Skip to main content
QUICK REVIEW

[论文解读] Efficient AutoML Pipeline Search with Matrix and Tensor Factorization

Chengrun Yang, Jicong Fan|arXiv (Cornell University)|Jun 7, 2020
Tensor decomposition and applications参考文献 62被引用 4
一句话总结

该论文提出了一种基于矩阵和张量分解的高效AutoML流水线搜索系统,用于建模跨数据集的流水线性能。通过利用低秩代理模型和贪婪实验设计,显著减少了昂贵的流水线评估次数,实现在大规模数据集上设计时间少于10秒的最先进性能。

ABSTRACT

Data scientists seeking a good supervised learning model on a new dataset have many choices to make: they must preprocess the data, select features, possibly reduce the dimension, select an estimation algorithm, and choose hyperparameters for each of these pipeline components. With new pipeline components comes a combinatorial explosion in the number of choices! In this work, we design a new AutoML system to address this challenge: an automated system to design a supervised learning pipeline. Our system uses matrix and tensor factorization as surrogate models to model the combinatorial pipeline search space. Under these models, we develop greedy experiment design protocols to efficiently gather information about a new dataset. Experiments on large corpora of real-world classification problems demonstrate the effectiveness of our approach.

研究动机与目标

  • 解决由于组件和超参数组合数量庞大而导致的AutoML流水线搜索中的组合爆炸问题。
  • 通过高效选择在新数据集上评估的有信息量的流水线,克服AutoML中的冷启动问题。
  • 利用低秩结构在跨数据集上学习可泛化的代理模型,以降低评估成本。
  • 通过结合矩阵/张量分解与贪婪实验设计,实现快速可扩展的流水线选择。
  • 通过最小化运行时开销,超越现有AutoML系统,实现高性能表现。

提出的方法

  • 使用低秩分解将流水线性能建模为矩阵或张量,以捕捉跨数据集、组件和超参数的依赖关系。
  • 利用矩阵和张量分解学习数据集和流水线的嵌入表示,实现在不同数据集间的迁移学习。
  • 应用贪婪实验设计选择最具有信息量的流水线优先评估,以最小化性能预测的遗憾。
  • 利用核化矩阵模型将框架扩展至处理流水线性能中的非线性关系。
  • 基于数据集大小和特征数量构建多项式运行时预测器,以支持时间约束下的流水线选择。
  • 通过预测超参数网格上的性能,构建超参数景观图,而无需显式优化。

实验结果

研究问题

  • RQ1低秩矩阵和张量分解模型能否有效表示跨多样化数据集的AutoML流水线组合空间?
  • RQ2贪婪实验设计在多大程度上能高效识别在新数据集上应优先评估的最具信息量的流水线?
  • RQ3基于历史数据训练的代理模型在仅进行最少评估的情况下,能在多大程度上预测未见数据集上的流水线性能?
  • RQ4该系统在保持预测准确性的前提下,能否泛化至不同类型的估计器和超参数范围?
  • RQ5运行时预测的集成在实践中如何提升时间约束下的流水线选择效果?

主要发现

  • 该系统在AutoML流水线选择任务中达到最先进性能,设计时间少于10秒,即使在大规模数据集上亦如此。
  • 在215×23424的误差矩阵上,经过100次评估后,贪婪方法相比随机选择将遗憾降低了30%。
  • 运行时预测器对所有估计器类型均实现了超过70%的准确率(误差因子为2以内),其中多层感知机达到74.5%的准确率。
  • 预测的超参数景观图与真实景观图高度吻合,能捕捉全局趋势与细粒度变化,仅使用粗网格。
  • 该方法在每个新数据集上仅需恒定数量的流水线评估,且与组件数量无关。
  • 该系统在多种OpenML数据集上表现出鲁棒性,对不同类型的估计器和数据特征均保持一致的性能表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。