Skip to main content
QUICK REVIEW

[论文解读] Supervised Infinite Feature Selection

Sadegh Eskandari, Emre Akbaş|arXiv (Cornell University)|Apr 9, 2017
Face and Expression Recognition参考文献 30被引用 4
一句话总结

该论文提出了 SIFS(监督无限特征选择)和 mIFS(用于无监督场景的改进 IFS),通过在监督场景中引入标签信息并改进冗余建模,从而增强原始的无限特征选择(IFS)方法。通过使用互信息和斯皮尔曼等级相关系数(SIFS)或标准差和互信息(mIFS)重新定义特征邻接矩阵,该方法在基准数据集上的平均分类准确率相比 IFS 和 mRMR 提升了高达 6%,在 12 个数据集上的平均提升达 1.89%。

ABSTRACT

In this paper, we present a new feature selection method that is suitable for both unsupervised and supervised problems. We build upon the recently proposed Infinite Feature Selection (IFS) method where feature subsets of all sizes (including infinity) are considered. We extend IFS in two ways. First, we propose a supervised version of it. Second, we propose new ways of forming the feature adjacency matrix that perform better for unsupervised problems. We extensively evaluate our methods on many benchmark datasets, including large image-classification datasets (PASCAL VOC), and show that our methods outperform both the IFS and the widely used "minimum-redundancy maximum-relevancy (mRMR)" feature selection algorithm.

研究动机与目标

  • 为解决原始 IFS 方法(无监督)无法捕捉特征冗余中复杂非线性依赖关系的局限性。
  • 开发一种利用类别标签改进特征相关性估计的 IFS 监督变体。
  • 提出一种新的无监督特征邻接矩阵构建方法,通过结合标准差和互信息,更好地捕捉特征相关性和冗余性。
  • 提升高维数据集上的特征选择性能,特别是在图像分类任务中。
  • 证明所提出的方法在多种基准数据集上优于 SOTA 方法(如 IFS 和 mRMR)。

提出的方法

  • SIFS 使用互信息衡量相关性、斯皮尔曼等级相关系数衡量冗余,构建监督型特征邻接矩阵,实现标签感知的特征选择。
  • mIFS 通过在邻接矩阵中结合基于标准差的相关性与基于互信息的冗余性,将 IFS 扩展至无监督设置。
  • 利用邻接矩阵的几何级数计算无限路径积分,高效计算特征中心性得分。
  • 通过基于从矩阵幂的无限和推导出的中心性得分对特征进行排序,实现特征选择。
  • 该方法应用于线性 SVM 和深度卷积神经网络(CNN)特征,通过归一化和交叉验证确定最优特征子集大小。
  • 源代码已公开,以支持可复现性和进一步基准测试。

实验结果

研究问题

  • RQ1与原始无监督 IFS 相比,无监督 IFS 的监督变体是否能提升分类准确率?
  • RQ2在监督特征选择任务中,引入斯皮尔曼等级相关系数进行冗余建模是否能提升性能?
  • RQ3使用标准差和互信息构建的改进型无监督 IFS 变体是否能在无监督基准上超越原始 IFS?
  • RQ4在多种数据集上,所提出方法与广泛使用的基于信息论的特征选择算法 mRMR 相比表现如何?
  • RQ5在大规模图像分类任务(如 PASCAL VOC 2007 和 2012)中,所提出方法的性能提升程度如何?

主要发现

  • 在 12 个基准数据集上,SIFS 的平均分类准确率相比 IFS 提升了 6%,证明了在特征选择中使用标签信息的优势。
  • 在 12 个数据集上,SIFS 平均比 mRMR 提升 1.89% 的分类准确率,表明其在监督设置下的优越性。
  • 在 12 个数据集中的 9 个上,mIFS 表现优于原始 IFS,尤其在 Arcene 数据集上提升 12%,在 Prostate 数据集上提升 7%。
  • 在 PASCAL VOC 2007 上,SIFS 达到 85.90% 的 mAP,优于 IFS(84.63%)和 mRMR(84.95%),且仅保留了 ResNet 特征的 40%。
  • 在 PASCAL VOC 2012 上,SIFS 达到 86.50% 的 mAP,优于 IFS(85.78%)和 mRMR(85.88%),同样仅保留了 40% 的 ResNet 特征。
  • SIFS 在所有数据集(包括图像分类、基因表达和医学数据)中均保持最高性能,证实了其鲁棒性和泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。