Skip to main content
QUICK REVIEW

[论文解读] Towards a more efficient representation of imputation operators in TPOT

Unai Garciarena, Alexander Mendiburu|arXiv (Cornell University)|Jan 13, 2018
Evolutionary Algorithms and Applications参考文献 16被引用 3
一句话总结

本文提出一种强类型遗传编程(GP)方法,以更高效地将插补方法(IMs)整合到TPOT(自动化机器学习流水线优化工具)中。通过将IMs重新定义为仅置于流水线起始位置的受限算子,该方法显著减少了不可行流水线的数量,提升了搜索效率与准确性,尽管因搜索空间更大而略微增加了运行时间。

ABSTRACT

Automated Machine Learning encompasses a set of meta-algorithms intended to design and apply machine learning techniques (e.g., model selection, hyperparameter tuning, model assessment, etc.). TPOT, a software for optimizing machine learning pipelines based on genetic programming (GP), is a novel example of this kind of applications. Recently we have proposed a way to introduce imputation methods as part of TPOT. While our approach was able to deal with problems with missing data, it can produce a high number of unfeasible pipelines. In this paper we propose a strongly-typed-GP based approach that enforces constraint satisfaction by GP solutions. The enhancement we introduce is based on the redefinition of the operators and implicit enforcement of constraints in the generation of the GP trees. We evaluate the method to introduce imputation methods as part of TPOT. We show that the method can notably increase the efficiency of the GP search for optimal pipelines.

研究动机与目标

  • 解决以往TPOT方法在引入插补方法(IMs)时产生大量不可行流水线的低效问题。
  • 通过在IM集成中施加结构约束,提升TPOT中遗传编程(GP)的搜索效率。
  • 使IMs能够作为流水线优化过程的一部分被演化,而非在开始时固定设置。
  • 在保持与TPOT现有基于语法的GP框架兼容的同时,增强其处理缺失数据的表达能力。
  • 为将该框架扩展至其他受限机器学习算子(如降维或特征缩放)奠定基础。

提出的方法

  • 在GP语法中将插补方法重新定义为特殊且受约束的算子,确保其仅置于流水线起始位置。
  • 引入一个概念性约束,强制要求每个流水线仅在开头位置包含一个IM,防止后续位置出现无效放置。
  • 使用强类型GP以确保类型一致性,并在树生成过程中防止无效流水线结构的产生。
  • 修改语法,嵌入约束以禁止多个或错误放置的IM,确保仅有效且已插补的数据流向下游组件。
  • 在TPOT现有GP框架基础上进行最小改动,以支持新的语法结构。
  • 通过防止IM在初始插补步骤后被插入,确保下游组件始终接收已插补的数据。

实验结果

研究问题

  • RQ1如何在不产生大量不可行流水线的前提下,高效地将插补方法整合到TPOT基于遗传编程的流水线搜索中?
  • RQ2强制IM仅置于流水线起始位置的严格放置约束,对搜索效率和解决方案质量有何影响?
  • RQ3具有嵌入约束的强类型GP语法,是否能提升TPOT在存在缺失数据时的收敛性与性能?
  • RQ4与以往将IM视为简单预处理单元的方法相比,该方法在准确率和计算成本方面表现如何?
  • RQ5这种基于约束的语法扩展在多大程度上可推广至自动化流水线优化中的其他机器学习算子?

主要发现

  • 在所有9个数据集上,采用新语法的增强版TPOT在所有评估阶段均实现了更高的平均准确率,尤其在早期阶段表现更优。
  • 由于强制IM仅置于流水线起始位置,不可行流水线的数量被大幅减少。
  • 尽管因评估的流水线数量更多而运行时间略有增加,但更高的搜索效率促使算法更快收敛至更优解。
  • 该方法降低了对随机生成的有效流水线的偏倚,使进化过程能够探索更多样化且更有效的流水线结构。
  • 结果表明,将IM集成到进化过程中,其模型性能优于固定预处理插补方法。
  • 该方法具有可扩展性,可轻松适配以整合其他受限机器学习算子(如特征缩放或降维)到流水线演化过程中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。