Skip to main content
QUICK REVIEW

[论文解读] Feature Selection from High-Dimensional Data with Very Low Sample Size: A Cautionary Tale

Ludmila I. Kuncheva, Clare Matthews|arXiv (Cornell University)|Aug 27, 2020
Gene expression and cancer classification参考文献 65被引用 14
一句话总结

本文警告在高维数据集且样本量极低(例如每类仅10个实例)的情况下进行特征选择的风险,通过理论分析和20个真实数据集的实验表明,此类方法往往产生误导性、过拟合的结果。主要发现是,当分类器与选择器未精心匹配时,特征选择可能使性能劣化程度超过使用全部特征;此外,交叉验证在此类情形下对乐观误差估计的保护作用有限。

ABSTRACT

In classification problems, the purpose of feature selection is to identify a small, highly discriminative subset of the original feature set. In many applications, the dataset may have thousands of features and only a few dozens of samples (sometimes termed `wide'). This study is a cautionary tale demonstrating why feature selection in such cases may lead to undesirable results. In view to highlight the sample size issue, we derive the required sample size for declaring two features different. Using an example, we illustrate the heavy dependency between feature set and classifier, which poses a question to classifier-agnostic feature selection methods. However, the choice of a good selector-classifier pair is hampered by the low correlation between estimated and true error rate, as illustrated by another example. While previous studies raising similar issues validate their message with mostly synthetic data, here we carried out an experiment with 20 real datasets. We created an exaggerated scenario whereby we cut a very small portion of the data (10 instances per class) for feature selection and used the rest of the data for testing. The results reinforce the caution and suggest that it may be better to refrain from feature selection from very wide datasets rather than return misleading output to the user.

研究动机与目标

  • 调查在每类仅有极少样本(例如每类10个)的高维数据集中进行特征选择的风险与局限性,这是生物信息学和多媒体领域中的常见情形。
  • 挑战在该类设置中交叉验证能可靠防止过拟合的假设,特别是当特征选择在用于误差估计的同一数据集上执行时。
  • 评估在宽维数据集中估计误差与真实分类误差之间的相关性,突出在样本量较低时误差估计的不稳定性。
  • 评估不同特征选择器与分类器组合的影响,揭示选择器与分类器的兼容性比排名方法的选择更为关键。
  • 基于20个真实数据集的实证证据表明,特征选择可能适得其反,主张在极宽数据集中应保持谨慎甚至避免使用。

提出的方法

  • 通过理论推导,确定能够可靠区分两个特征所需的样本量,表明可能需要数百个样本才能实现可靠选择。
  • 在20个真实数据集上进行实验评估,仅使用每类10个实例进行特征选择,其余样本保留用于测试,以模拟极端低样本量条件。
  • 使用留一法(LOO)交叉验证进行误差估计,并将LOO估计值与保留测试集上测得的真实误差进行比较。
  • 系统性地比较10种特征选择方法(例如RFE、RelF、SU、EX10)与5种分类器(例如NB、RF、SVM、1NN、SVML)在所有数据集上的表现。
  • 使用保留数据的测试误差评估性能,结果分析聚焦于选择器-分类器配对及排名方法的影响。
  • 使用穷举搜索(EX10)识别理论上最优的特征子集,作为比较的基准。

实验结果

研究问题

  • RQ1在分类任务中,为可靠区分两个特征,需要多大的样本量?这与在小样本量设置下特征选择的可行性有何关联?
  • RQ2当在极小数据集上执行特征选择时,交叉验证的误差估计与真实泛化误差之间的相关性如何?
  • RQ3特征选择器的选择是否显著影响性能?还是选择器与下游分类器之间的交互作用更为关键?
  • RQ4在极宽数据集中,特征选择能否提高分类准确率,还是更可能因过拟合和估计偏差而使性能劣化?
  • RQ5在何种条件下——具体而言,哪些选择器与分类器的组合——可以安全地应用于高维、小样本量数据?

主要发现

  • 在仅每类10个样本的极宽数据集中进行特征选择,常导致泛化性能差,即使使用穷举搜索,表现最佳的特征子集也未必对应最低的真实误差。
  • 留一法(LOO)误差估计与保留测试集上测得的真实误差相关性较差,表明在此类情形下误差估计极不可靠。
  • 分类器与特征选择器的组合比所用排名方法更为重要;例如,线性分类器(NB、1NN)在使用全部特征时表现最佳,因此无需进行特征选择。
  • 计算复杂度较高的选择器(如RFE、EX10)显著逊于简单快速的方法,表明选择过程中数据过度使用导致过拟合。
  • 在某些数据集中,LOO误差估计表现最佳的特征子集并未带来最低的测试误差,表明即使LOO在样本量极低时也可能具有误导性。
  • 本研究结论认为,对于极宽数据集,最好完全避免特征选择,以免返回误导性、过拟合的结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。