Skip to main content
QUICK REVIEW

[论文解读] Efficient Wrapper Feature Selection using Autoencoder and Model Based Elimination

Sharan Ramjee, Aly El Gamal|arXiv (Cornell University)|May 28, 2019
Machine Learning in Bioinformatics参考文献 26被引用 4
一句话总结

该论文提出AMBER,一种计算高效的包装器特征选择方法,结合自编码器进行冗余检测和单次训练的排序模型进行相关性评分,从而实现无需重新训练的贪心后向消除。AMBER在多个数据集上实现了高于基线方法的分类准确率,包括在将特征从256个减少到64个后,RadioML2016.10b数据集上的准确率达到99%,证明其在计算成本更低的前提下性能更优。

ABSTRACT

We propose a computationally efficient wrapper feature selection method - called Autoencoder and Model Based Elimination of features using Relevance and Redundancy scores (AMBER) - that uses a single ranker model along with autoencoders to perform greedy backward elimination of features. The ranker model is used to prioritize the removal of features that are not critical to the classification task, while the autoencoders are used to prioritize the elimination of correlated features. We demonstrate the superior feature selection ability of AMBER on 4 well known datasets corresponding to different domain applications via comparing the classification accuracies with other computationally efficient state-of-the-art feature selection techniques. Interestingly, we find that the ranker model that is used for feature selection does not necessarily have to be the same as the final classifier that is trained on the selected features. Finally, we note how a smaller number of features can lead to higher accuracies on some datasets, and hypothesize that overfitting the ranker model on the training set facilitates the selection of more salient features.

研究动机与目标

  • 解决传统包装器特征选择方法在每次迭代中重新训练分类器所导致的高计算成本问题。
  • 通过将自编码器实现的冗余检测整合到包装器方法中,提升特征选择的准确性,而传统方法通常忽略特征间的相关性。
  • 通过仅训练一次排序模型,在保持高分类性能的同时减少训练时间。
  • 探究过度拟合排序模型对特征相关性评分区分度的影响。
  • 在高维场景下,平衡过滤方法的计算效率与包装器方法的高性能。

提出的方法

  • AMBER使用一个预先训练好的单次排序模型(如神经网络),根据输入层权重大小为特征分配相关性评分。
  • 在数据集上训练自编码器,以识别并分组相关特征,从而实现冗余特征的检测。
  • 基于排序模型的相关性评分(来自排序模型)和自编码器重构误差的冗余度,计算综合评分以对特征进行排序并决定移除顺序。
  • 通过贪心后向消除策略,每一步迭代中移除相关性最低且冗余度最高的特征。
  • 最终的特征子集根据排序模型在精简特征集上的表现进行选择,从而在不进行完整重训练的情况下模拟模型准确率。
  • 通过延长训练周期过度拟合排序模型,可增强显著特征与非显著特征之间权重大小的差异,从而提升选择的准确性。

实验结果

研究问题

  • RQ1结合单次训练排序模型与自编码器,能否在显著降低计算成本的同时实现具有竞争力的特征选择准确率?
  • RQ2通过自编码器集成冗余检测是否能提升包装器方法的特征选择性能,相比标准包装器方法?
  • RQ3过度拟合排序模型是否能增强显著特征与非显著特征之间相关性评分的区分度?
  • RQ4AMBER在多样化的现实世界数据集上,与最先进过滤方法和包装器方法相比,在准确率和效率方面表现如何?
  • RQ5通过AMBER进行特征降维在多大程度上能缓解高维数据集中的过拟合问题并提升泛化能力?

主要发现

  • AMBER在四个基准数据集上的分类准确率均高于所有对比的最先进方法,包括在将特征从256个减少到64个后,RadioML2016.10b数据集上的准确率达到99%。
  • 在威斯康星州乳腺癌数据集上,AMBER的准确率甚至超过了全特征模型,表明其通过去除噪声或冗余特征有效缓解了过拟合。
  • 在RadioML2016.10b数据集中,准确率从使用全部256个特征时的93%提升至使用64个选定特征时的99%,表明其有效减少了噪声和冗余。
  • PCA可视化结果证实,AMBER在降维后的特征空间中提升了类别可分性,尤其对之前被误分类的AM-DSM和WBFM类别效果显著。
  • 通过延长训练周期过度拟合排序模型,显著提升了显著特征与非显著特征之间输入层权重大小的差异,从而增强了相关性评分的区分能力。
  • AMBER的运行时间显著短于传统包装器方法(后者在每次迭代中均需重新训练),仅略长于最快的过滤方法,实现了速度与准确率的优异平衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。