[论文解读] DIFER: Differentiable Automated Feature Engineering
DIFER 提出了一种首个可微分的自动化特征工程方法,通过编码器-预测器-解码器框架在连续向量空间中执行特征搜索。通过梯度上升优化特征嵌入,并将它们解码回离散特征,DIFER 在仅使用比先前方法少40倍的特征评估次数的情况下,实现了最先进(SOTA)的性能表现。
Feature engineering, a crucial step of machine learning, aims to extract useful features from raw data to improve data quality. In recent years, great efforts have been devoted to Automated Feature Engineering (AutoFE) to replace expensive human labor. However, existing methods are computationally demanding due to treating AutoFE as a coarse-grained black-box optimization problem over a discrete space. In this work, we propose an efficient gradient-based method called DIFER to perform differentiable automated feature engineering in a continuous vector space. DIFER selects potential features based on evolutionary algorithm and leverages an encoder-predictor-decoder controller to optimize existing features. We map features into the continuous vector space via the encoder, optimize the embedding along the gradient direction induced by the predicted score, and recover better features from the optimized embedding by the decoder. Extensive experiments on classification and regression datasets demonstrate that DIFER can significantly improve the performance of various machine learning algorithms and outperform current state-of-the-art AutoFE methods in terms of both efficiency and performance.
研究动机与目标
- 为解决现有自动化特征工程(AutoFE)方法在离散特征空间中所面临的计算效率低下和特征爆炸问题。
- 通过将搜索过程建模为连续优化问题,实现高效且有效的自动化特征工程。
- 基于编码器-预测器-解码器架构,开发一种新型特征优化器,支持端到端可微分的特征演化。
- 证明可微分特征搜索可显著提升模型性能,同时降低计算成本。
- 提供一种灵活且可扩展的自动化特征工程框架,适用于多种机器学习任务。
提出的方法
- 提出一种进化框架,通过在潜在向量空间中进行连续优化,迭代生成更优特征。
- 使用解析树结构表示特征,实现对复杂特征转换的灵活且富有表现力的表示。
- 采用编码器将解析树的遍历字符串映射为连续嵌入向量。
- 使用预测器网络基于特征嵌入估计其性能得分,从而实现基于梯度的优化。
- 在嵌入空间中应用梯度上升以优化更高性能的特征,随后通过解码器将优化后的嵌入重构为离散特征。
- 将整个流程整合为一个可微分的端到端框架,支持通过特征构建过程进行反向传播。
实验结果
研究问题
- RQ1在连续潜在空间中进行可微分优化,是否能优于在离散搜索空间中的自动化特征工程?
- RQ2DIFER 的连续特征优化方法在模型性能和计算效率方面,与现有 AutoFE 方法相比如何?
- RQ3与基于序列的方法相比,解析树表示在多大程度上提升了特征构建的表达能力和灵活性?
- RQ4DIFER 中的基于梯度的特征优化器是否在不同机器学习算法和数据集上具有泛化能力?
- RQ5DIFER 的性能对嵌入空间中的超参数选择和初始化有多敏感?
主要发现
- 在25个分类和回归数据集中的22个上,DIFER 的模型性能优于最先进(SOTA)的 AutoFE 方法。
- DIFER 仅使用比 SOTA 方法少40倍的特征评估次数,实现了这一性能提升,显著提高了计算效率。
- 该方法在多种数据集和机器学习模型上均表现出一致的性能增益,表明其具备强大的泛化能力。
- 消融实验确认,可微分优化组件以及编码器-预测器-解码器架构对 DIFER 性能至关重要。
- 与基于序列的表示相比,使用解析树能够实现更具表现力和灵活性的特征构建,从而提升了搜索效率和质量。
- DIFER 的实现代码已公开发布于 GitHub,支持可复现性并促进进一步研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。