[论文解读] AutoML using Metadata Language Embeddings
该论文提出了一种元-AutoML框架,通过利用数据集元数据和机器学习流水线文档的NLP嵌入来增强自动化机器学习。通过训练神经网络以基于嵌入的数据集和算法描述预测最优流水线之间的相似性,该系统实现了与最先进工具相当的零样本AutoML性能——在不到一秒内完成,且在60秒计算限制下优于OBOE、AutoSklearn、AlphaD3M和TPOT。
As a human choosing a supervised learning algorithm, it is natural to begin by reading a text description of the dataset and documentation for the algorithms you might use. We demonstrate that the same idea improves the performance of automated machine learning methods. We use language embeddings from modern NLP to improve state-of-the-art AutoML systems by augmenting their recommendations with vector embeddings of datasets and of algorithms. We use these embeddings in a neural architecture to learn the distance between best-performing pipelines. The resulting (meta-)AutoML framework improves on the performance of existing AutoML frameworks. Our zero-shot AutoML system using dataset metadata embeddings provides good solutions instantaneously, running in under one second of computation. Performance is competitive with AutoML systems OBOE, AutoSklearn, AlphaD3M, and TPOT when each framework is allocated a minute of computation. We make our data, models, and code publicly available.
研究动机与目标
- 通过将人类可读的数据集描述和算法文档整合到自动化流水线选择中,提升AutoML性能。
- 开发一种零样本AutoML系统,通过数据集和算法的语义嵌入即时推荐高性能流水线。
- 创建一个新的基准数据集AutoKaggle,其中包含来自Kaggle竞赛的结构化元数据、任务和可执行流水线。
- 学习一个度量空间,使相似的数据集和最优流水线在其中被嵌入得更接近,从而实现在不同数据集之间的迁移学习。
- 证明基于NLP的未结构化文本(如数据集标题、描述和算法文档)嵌入可显著提升AutoML推荐的准确性。
提出的方法
- 该方法使用预训练的语言模型从自由文本的数据集元数据(标题、描述、关键词)和算法文档中生成密集向量嵌入。
- 它构建一个神经网络,通过最小化最佳流水线相似的数据集嵌入之间的距离,学习数据集嵌入上的度量。
- 该系统采用零样本推理策略:对于新数据集,计算其元数据嵌入,并检索在最近似训练数据集中表现最佳的流水线。
- 它引入了一个流水线嵌入空间,其中每个流水线被表示为由其组成组件和文档派生的向量。
- 定义了一个度量学习目标,使数据集嵌入之间的距离与它们各自最佳流水线嵌入之间的距离对齐。
- 该框架使用AutoKaggle数据集进行评估,该数据集是Kaggle竞赛元数据、任务和可执行流水线的精选集合,已转换为与Scikit-learn兼容的格式。
实验结果
研究问题
- RQ1与传统元特征相比,数据集元数据的NLP嵌入是否能提升零样本AutoML性能?
- RQ2机器学习流水线文档的嵌入是否能增强AutoML系统在多样化数据集上的泛化能力?
- RQ3在数据集嵌入与流水线嵌入之间学习联合度量空间是否能提升AutoML中的迁移性能?
- RQ4在时间约束下,使用元数据嵌入的零样本AutoML系统性能与最先进AutoML框架相比如何?
- RQ5Kaggle上人类生成的获胜流水线在多大程度上与基于学习嵌入推导出的推荐结果一致?
主要发现
- 仅使用数据集元数据嵌入的零样本AutoML系统(Ours DE)在9个表格分类数据集上平均准确率达到0.87,运行时间不足1秒。
- 基于流水线嵌入的系统(Ours PE)在基线AutoML工具之上进一步提升了性能,在HR数据集上达到0.90的准确率,在Titanic数据集上达到0.87,与或超过人类生成的流水线。
- 在Seattle数据集上,系统在零样本模式下实现了1.00的准确率,与OBOE和TPOT在60秒时间预算下的表现相当。
- 当所有系统均获得60秒计算时间时,该方法在9个数据集中的6个上优于OBOE、AutoSklearn、AlphaD3M和TPOT。
- 神经度量学习框架成功捕捉了数据集与最优流水线之间的语义相似性,仅基于文本元数据即可实现准确的零样本推荐。
- 包含100多个Kaggle竞赛解决方案的AutoKaggle数据集,以可执行的Scikit-learn格式提供,支持AutoML系统的可重现评估与基准测试。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。