Skip to main content
QUICK REVIEW

[論文レビュー] Feature Selection from High-Dimensional Data with Very Low Sample Size: A Cautionary Tale

Ludmila I. Kuncheva, Clare Matthews|arXiv (Cornell University)|Aug 27, 2020
Gene expression and cancer classification参考文献 65被引用数 14
ひとこと要約

この論文は、非常に少ないサンプル数(例:1クラスあたり10件)の高次元データセットにおける特徴選択の危険性を警告している。理論的分析と20個の実データセットを用いた実験を通じて、このような手法はしばしば誤った、過剰適合した結果を生じることを示している。主な発見は、特徴選択がすべての特徴を使用するよりも性能を劣化させることがあること、特に分類器が選択器に適切に一致していない場合に顕著であり、この状況では交差検証が楽観的な誤差推定に対してほとんど保護を提供しないことである。

ABSTRACT

In classification problems, the purpose of feature selection is to identify a small, highly discriminative subset of the original feature set. In many applications, the dataset may have thousands of features and only a few dozens of samples (sometimes termed `wide'). This study is a cautionary tale demonstrating why feature selection in such cases may lead to undesirable results. In view to highlight the sample size issue, we derive the required sample size for declaring two features different. Using an example, we illustrate the heavy dependency between feature set and classifier, which poses a question to classifier-agnostic feature selection methods. However, the choice of a good selector-classifier pair is hampered by the low correlation between estimated and true error rate, as illustrated by another example. While previous studies raising similar issues validate their message with mostly synthetic data, here we carried out an experiment with 20 real datasets. We created an exaggerated scenario whereby we cut a very small portion of the data (10 instances per class) for feature selection and used the rest of the data for testing. The results reinforce the caution and suggest that it may be better to refrain from feature selection from very wide datasets rather than return misleading output to the user.

研究の動機と目的

  • 非常に少ないサンプル数(例:1クラスあたり10件)の高次元データセットにおける特徴選択のリスクと限界を調査すること。これは、バイオインフォマティクスやマルチメディア分野で一般的な状況である。
  • 特に特徴選択が誤差推定に使われる同じデータ上で行われる場合に、交差検証がこの状況で過剰適合を信頼的に防げるとする仮定に疑問を呈すること。
  • 広いデータセットにおける誤差推定値と真の分類誤差の相関関係を評価し、サンプル数が少ない状況での誤差推定の不安定性を強調すること。
  • 異なる特徴選択器と分類器の組み合わせが与える影響を評価し、選択器と分類器の適合性が順序付け手法の選択よりも重要であることを明らかにすること。
  • 20個の実世界データセットを用いた実証的証拠を提供し、特徴選択が逆効果である可能性があることを示唆し、特に非常に広いデータセットでは注意を要する、あるいは回避することを提言すること。

提案手法

  • 2つの特徴を信頼性を持って区別できるために必要なサンプルサイズを理論的に導出。信頼できる選択に数百件のサンプルが必要となる可能性があることを示している。
  • 20個の実データセットを用いた実験評価。特徴選択には1クラスあたり10件のサンプルのみを使用し、残りのデータはテスト用に別途確保することで、極端にサンプル数が少ない状況を模擬した。
  • 誤差推定に留めず、LOO(1つを除いて訓練)交差検証を用い、LOO推定誤差と別途確保したテストセットで測定した真の誤差を比較した。
  • 10種類の特徴選択手法(例:RFE, RelF, SU, EX10)と5種類の分類器(例:NB, RF, SVM, 1NN, SVML)をすべてのデータセットで組み合わせて系統的比較した。
  • 左側に別けたデータに対するテスト誤差を評価指標とし、選択器と分類器のペairリングの影響を分析するための結果分析を行った。
  • 理論的最適特徴サブセットを特定するための全探索(EX10)を用い、比較のためのベンチマークとして使用した。

実験結果

リサーチクエスチョン

  • RQ1分類タスクにおいて2つの特徴を信頼性を持って区別するにはどの程度のサンプルサイズが必要か。また、これはサンプル数が少ない状況における特徴選択の可能性とどのように関係するか。
  • RQ2非常に小さなデータセットで特徴選択が行われる場合、交差検証による誤差推定値と真の汎化誤差の相関関係はどの程度か。
  • RQ3特徴選択器の選択が性能に顕著な影響を与えるのか、それとも選択器と後続の分類器との相互作用がより重要なのか。
  • RQ4非常に広いデータセットにおいて、特徴選択は分類精度を向上させることができるのか、それとも過剰適合と推定バイアスのため、性能を劣化させる可能性が高いのか。
  • RQ5具体的には、どの選択器と分類器の組み合わせが、高次元でサンプル数が少ないデータに対して安全に特徴選択を適用できるのか。

主な発見

  • 1クラスあたり10件のサンプルしかなく、非常に広いデータセットにおいて特徴選択を行うと、一般化性能が著しく劣化することが多く、最良の性能を示す特徴サブセットでさえ、真の誤差が最小になるとは限らない。全探索法を用いても同様の結果が得られた。
  • LOO誤差推定値と別途確保したテストセットで測定した真の誤差の間には、相関が非常に弱く、この状況では誤差推定が極めて信頼性がないことを示している。
  • 分類器と特徴選択器の組み合わせの重要性が、順序付け手法の選択よりも顕著であった。例えば、線形分類器(NB, 1NN)はすべての特徴を使用した場合に最も良い性能を示し、特徴選択は不要であった。
  • 計算コストの高い選択器(例:RFE, EX10)は、単純で高速な手法に比べて顕著に劣った性能を示した。これは、選択プロセスでデータを過剰に使用することで過剰適合が生じたためである。
  • 一部のデータセットでは、LOO誤差で最も良い性能を示した特徴サブセットが、実際にテスト誤差が最小になるとは限らず、LOOでさえサンプル数が極めて少ない場合には誤解を招く可能性があることを示している。
  • 本研究の結論として、非常に広いデータセットでは、誤った過剰適合結果を返すリスクを避けるために、特徴選択を一切行わない方が望ましい場合がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。