Skip to main content
QUICK REVIEW

[论文解读] Effective Discriminative Feature Selection with Non-trivial Solutions

Hong Tao, Chenping Hou|arXiv (Cornell University)|Apr 21, 2015
Face and Expression Recognition参考文献 29被引用 6
一句话总结

本文提出了一种新颖的特征选择方法——判别性特征选择(DFS),将线性判别分析(LDA)与ℓ₂,p-范数正则化相结合,以同时选择最具判别性的特征并消除冗余特征。通过将问题表述为ℓ₂,p-最小化问题(0 < p ≤ 2),该方法在现有基于LDA和过滤法的方法之上实现了更高的稀疏性与性能,且所提出的快速收敛算法被证明具有单调收敛性。

ABSTRACT

Feature selection and feature transformation, the two main ways to reduce dimensionality, are often presented separately. In this paper, a feature selection method is proposed by combining the popular transformation based dimensionality reduction method Linear Discriminant Analysis (LDA) and sparsity regularization. We impose row sparsity on the transformation matrix of LDA through ${\ell}_{2,1}$-norm regularization to achieve feature selection, and the resultant formulation optimizes for selecting the most discriminative features and removing the redundant ones simultaneously. The formulation is extended to the ${\ell}_{2,p}$-norm regularized case: which is more likely to offer better sparsity when $0

研究动机与目标

  • 解决传统基于过滤的特征选择方法在处理特征交互与冗余方面存在的局限性。
  • 将线性判别分析(LDA)的判别能力与稀疏性正则化相结合,以实现更优的特征选择。
  • 开发一种能够同时选择最具判别性的特征并去除高度相关冗余特征的方法。
  • 将ℓ₂,1-范数公式扩展至ℓ₂,p-范数正则化,以在0 < p < 1时获得更优的稀疏性逼近。
  • 设计一种高效且收敛的算法,用于求解特征选择背景下ℓ₂,p-范数最小化问题。

提出的方法

  • 通过在LDA变换矩阵上施加ℓ₂,p-范数正则化,将特征选择问题建模为稀疏LDA问题,以诱导行稀疏性。
  • 采用ℓ₂,p-范数最小化目标,促进特征间的组稀疏性,从而增强对判别性与非冗余特征的选择能力。
  • 基于交替方向乘子法(ADMM)开发了一种迭代优化算法,用于求解0 < p ≤ 2条件下的非凸ℓ₂,p问题。
  • 证明了在给定条件下,所提出的算法能单调递减目标函数,并收敛至一个驻点。
  • 对总散度矩阵St施加正则化,以解决高维设置下的奇异性问题。
  • 在算法中引入重加权策略,以逼近ℓ₂,p-最小化,从而提升稀疏性与收敛性。

实验结果

研究问题

  • RQ1与ℓ₂,1-范数相比,ℓ₂,p-范数正则化是否能提升基于LDA方法的特征选择性能?
  • RQ2所提出的DFS方法是否能有效减少特征冗余,同时保持判别能力?
  • RQ3ℓ₂,p-范数中参数p的选择如何影响稀疏性与分类准确率?
  • RQ4所提出的ℓ₂,p-最小化优化算法在实际中是否高效且具有收敛性?
  • RQ5DFS在性能与计算成本方面与现有基于过滤和嵌入的特征选择方法相比如何?

主要发现

  • 在COIL20与COLON等多个真实世界数据集上,DFS在p = 0.1与p = 0.5时均实现了优于基线方法的分类准确率。
  • 在COIL20与COLON数据集上,所有测试的p值(0.1、0.5、1)下,算法均在20次迭代内完成收敛,表现出快速收敛性。
  • 性能对正则化参数γ较为敏感,最优γ值因数据集而异,但随着γ增大,分类准确率在达到峰值后开始下降。
  • DFS在p = 1(等价于ℓ₂,1)时,在COIL20与ISOLET5数据集上的分类准确率优于LS、mRMR、RF与TR方法。
  • BAHSIC因需迭代更新核矩阵而成为最慢的方法,DFS(p=1)虽快于BAHSIC,但仍慢于LS与TR等简单方法。
  • 目标函数单调递减,且连续变换矩阵A之间的差异收敛至零,证实了算法的稳定性和收敛性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。