Skip to main content
QUICK REVIEW

[论文解读] Preprocessor Selection for Machine Learning Pipelines

Brandon Schoenfeld, Christophe Giraud-Carrier|arXiv (Cornell University)|Oct 23, 2018
Machine Learning and Data Classification参考文献 5被引用 8
一句话总结

本文提出使用元学习来指导机器学习流水线中的预处理器选择,表明尽管预处理在平均情况下会降低准确率,但最准确的流水线仍然使用了预处理。通过在10,368次实验上训练随机森林元学习器,作者实现了62.6%的准确率来预测预处理器是否能提升性能,从而使AutoML系统能够智能地选择预处理器并减少搜索空间。

ABSTRACT

Much of the work in metalearning has focused on classifier selection, combined more recently with hyperparameter optimization, with little concern for data preprocessing. Yet, it is generally well accepted that machine learning applications require not only model building, but also data preprocessing. In other words, practical solutions consist of pipelines of machine learning operators rather than single algorithms. Interestingly, our experiments suggest that, on average, data preprocessing hinders accuracy, while the best performing pipelines do actually make use of preprocessors. Here, we conduct an extensive empirical study over a wide range of learning algorithms and preprocessors, and use metalearning to determine when one should make use of preprocessors in ML pipeline design.

研究动机与目标

  • 研究预处理对机器学习流水线性能的影响,特别是与分类准确率和运行时间的关系。
  • 将元学习的应用从分类器和超参数选择扩展到机器学习流水线中的预处理器选择。
  • 开发一个预测模型,基于数据集的元特征判断预处理器是否能提升分类器的性能。
  • 评估元学习引导的预处理器选择在AutoML场景下相对于基线策略的有效性。
  • 通过基于数据集特征和所选分类器的智能推荐,减少AutoML系统的搜索空间。

提出的方法

  • 从OpenML平台收集了192个数据集上超过10,368个机器学习流水线的数据,其中前两个步骤为固定的数据显示清理(插补和独热编码)。
  • 评估了8种预处理器(如Min-Max归一化、主成分分析、多项式特征)和6种分类器(如随机森林、逻辑回归),均使用默认超参数。
  • 构建了一个元数据集,包含每个数据集提取的18个简单元特征、8个统计元特征、1个信息论元特征和14个定位元特征,外加独热编码的预处理器标识符。
  • 训练一个随机森林分类器作为元学习器,以预测给定预处理器是否能提升测试准确率(相对于无预处理的基线)。
  • 通过四个代理模拟AutoML环境:无预处理、随机选择、模式选择和Oracle——其中Oracle使用训练好的元学习器指导预处理器选择。
  • 通过测量各代理所选流水线相较于通过暴力搜索找到的最优流水线的性能差距,评估代理表现。

实验结果

研究问题

  • RQ1在多样化的数据集和分类器上,预处理是否始终能提升分类准确率?
  • RQ2元学习能否基于数据集的元特征预测哪些预处理器能提升分类器的性能?
  • RQ3在AutoML流水线中,元学习引导的预处理器选择与随机选择、基于模式的选择或无预处理策略相比表现如何?
  • RQ4在机器学习流水线中使用预处理器时,准确率与运行时间之间存在何种权衡?
  • RQ5元模型能否通过基于数据集特征和分类器选择智能推荐预处理器,从而减少AutoML系统的搜索空间?

主要发现

  • 平均而言,预处理虽能减少训练和预测的运行时间,但往往对分类准确率产生负面影响。
  • 尽管存在平均负面影响,最准确的流水线(在训练和测试数据上)显著更可能包含预处理器。
  • 元学习器在预测预处理器是否能提升基线准确率方面达到了62.6%的准确率,优于模式基线(53.0%)
  • 使用元学习器指导预处理器选择的Oracle代理,其平均性能比最优流水线差-6.19%,优于模式代理(-6.57%),并显著优于随机代理(-15.40%)和无预处理代理(-10.51%)
  • 元学习器成功通过基于数据集特征和分类器选择识别出有前景的预处理器,从而减少了AutoML系统的有效搜索空间。
  • 36个流水线因将独热编码与多项式特征结合导致维度爆炸而失败,凸显了实际应用中预处理器选择需格外谨慎。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。