[论文解读] E2E-FS: An End-to-End Feature Selection Method for Neural Networks
E2E-FS 是一种新颖的端到端特征选择方法,适用于神经网络。该方法通过在所选特征数量上施加硬性约束,将 Lasso 类正则化的准确性与过滤方法的可解释性相结合。它使用梯度下降在单步内联合优化模型训练与特征选择,实现了在包括图像和微阵列数据在内的多种数据集上的最先进性能。
Classic embedded feature selection algorithms are often divided in two large groups: tree-based algorithms and lasso variants. Both approaches are focused in different aspects: while the tree-based algorithms provide a clear explanation about which variables are being used to trigger a certain output, lasso-like approaches sacrifice a detailed explanation in favor of increasing its accuracy. In this paper, we present a novel embedded feature selection algorithm, called End-to-End Feature Selection (E2E-FS), that aims to provide both accuracy and explainability in a clever way. Despite having non-convex regularization terms, our algorithm, similar to the lasso approach, is solved with gradient descent techniques, introducing some restrictions that force the model to specifically select a maximum number of features that are going to be used subsequently by the classifier. Although these are hard restrictions, the experimental results obtained show that this algorithm can be used with any learning model that is trained using a gradient descent algorithm.
研究动机与目标
- 解决嵌入式方法中特征选择准确性与模型可解释性之间的权衡问题。
- 在保持高性能的同时,实现对所选特征数量的精确控制。
- 开发一种兼容通过梯度下降训练的任意模型(包括深度神经网络)的方法。
- 与 SVM-RFE 或 SFS 等递归方法相比,通过避免多次模型重训,降低计算成本。
- 为高维机器学习任务提供统一、高效且可扩展的特征选择解决方案。
提出的方法
- 该方法将特征选择建模为一个约束优化问题,其中二值掩码向量 𝛾 ∈ {0,1}^F 用于选择特征,且 ||𝛾||₁ ≤ M 约束所选特征数不超过 M 个。
- 引入使用 softplus 函数的可微分松弛,以实现基于梯度的优化,支持反向传播。
- 损失函数结合了模型的预测误差与一个非凸正则化项,以促进 𝛾 的稀疏性。
- 使用标准优化器(如 Adam、SGD)进行端到端训练,最终使用掩码 𝛾 选择前 M 个特征。
- 该方法兼容任意可微分模型,包括全连接网络和卷积神经网络(CNNs)。
- 该方法采用两阶段训练流程:首先进行稳定掩码的预热阶段,随后在固定超参数(如权重衰减 5e-4,70 个周期)下进行联合训练。
实验结果
研究问题
- RQ1单步端到端方法是否能在神经网络训练中同时实现高准确率与可控的特征数量?
- RQ2与递归或迭代式特征选择技术相比,所提出方法在计算效率和性能方面表现如何?
- RQ3对特征数量施加硬性上限是否能在不牺牲准确率的前提下提升泛化能力或模型可解释性?
- RQ4该方法是否能有效应用于多种数据类型,包括图像和高维生物数据?
- RQ5二值掩码的可微分松弛如何影响收敛性和特征选择的稳定性?
主要发现
- 在 Fashion-MNIST、CIFAR-10 和 CIFAR-100 上,E2E-FS-Soft 达到了最先进准确率,优于 DFS、SFS、iSFS 和 SFS+DFS 在所有特征数量下的表现。
- 在 CIFAR-10 上,E2E-FS-Soft 在使用 392 个特征时达到 93.68% 的准确率,比次优方法 SFS+DFS(92.59%)高出 1.3%。
- 在 CIFAR-100 上,E2E-FS-Soft 在使用 1536 个特征时达到 70.30% 的准确率,较 DFS(67.42%)和 SFS+DFS(64.94%)高出超过 5%。
- 该方法将 CIFAR-100 的训练时间减少至约 4180 秒,显著快于 iSFS(约 39 小时)和 SFS+DFS(7260 秒)。
- 在低特征数量下性能提升最为显著:在仅选择 153 个特征时,CIFAR-100 上的准确率提升了 29%。
- 该方法在二值数据集(如 MNIST)上表现有限,其性能低于 DFS,表明其对数据类型特性的敏感性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。