Skip to main content
QUICK REVIEW

[论文解读] Feature Selection Using Classifier in High Dimensional Data

Vijendra Singh, Shivani Pathak|arXiv (Cornell University)|Jan 5, 2014
Gene expression and cancer classification参考文献 6被引用 3
一句话总结

本文提出一种混合特征选择方法,结合过滤法与包装法,利用QDA和LDA分类器在降低高维数据维度的同时保持分类性能。结果表明,基于单变量准则的过滤法在生物信息学数据集上实现的误分类错误率低于使用序列特征选择的包装法。

ABSTRACT

Feature selection is frequently used as a pre-processing step to machine learning. It is a process of choosing a subset of original features so that the feature space is optimally reduced according to a certain evaluation criterion. The central objective of this paper is to reduce the dimension of the data by finding a small set of important features which can give good classification performance. We have applied filter and wrapper approach with different classifiers QDA and LDA respectively. A widely-used filter method is used for bioinformatics data i.e. a univariate criterion separately on each feature, assuming that there is no interaction between features and then applied Sequential Feature Selection method. Experimental results show that filter approach gives better performance in respect of Misclassification Error Rate.

研究动机与目标

  • 为应对机器学习中高维数据的挑战,通过减少特征空间同时保持分类准确性。
  • 比较过滤法与包装法在高维设置下的有效性。
  • 评估QDA和LDA分类器在指导高维数据降维特征选择中的性能。
  • 确定单变量过滤法是否在误分类错误率方面优于序列包装法。
  • 评估特征选择在提升生物信息学数据集分类性能方面的实用性。

提出的方法

  • 过滤法对每个特征独立应用单变量准则,假设特征间无交互作用,基于单个特征的相关性对特征进行排序和选择。
  • 包装法使用序列前向选择(SFS)作为搜索策略,并以QDA和LDA作为评估准则,迭代选择特征子集。
  • 使用LDA和QDA分类器作为底层模型执行特征选择,以评估子集性能。
  • 过滤方法基于统计准则评估特征,无需训练分类器;而包装方法则使用分类器准确率作为评估指标。
  • 在生物信息学数据集上比较两种方法,评估其对误分类错误率的影响。
  • 性能评估以误分类错误率作为主要指标,在多个数据集上进行。

实验结果

研究问题

  • RQ1在高维生物信息学数据上,过滤法是否在误分类错误率方面优于包装法?
  • RQ2当忽略特征交互作用时,单变量过滤准则在选择相关特征方面的有效性如何?
  • RQ3QDA和LDA分类器能否作为高维数据集包装法特征选择中的有效评估器?
  • RQ4通过特征选择进行降维在多大程度上提升了分类性能?
  • RQ5在高维数据中,过滤法中特征独立性的假设在实践中是否合理?

主要发现

  • 在所评估的数据集中,过滤法实现的误分类错误率低于包装法。
  • 单变量过滤准则在忽略特征交互作用的情况下仍能有效识别相关特征,表现出良好性能。
  • 使用QDA和LDA作为包装分类器的序列特征选择未能超越更简单的过滤方法。
  • 在包装框架中使用LDA和QDA作为分类器,并未显著提升分类准确率,相较于过滤法。
  • 结果表明,过滤法在高维数据中更具效率和有效性,尤其在生物信息学场景中。
  • 本研究证实,特征选择显著降低了误分类错误率,且过滤法在性能与计算成本之间提供了最佳平衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。