Skip to main content
QUICK REVIEW

[論文レビュー] Feature Selection with the R Package MXM: Discovering Statistically-Equivalent Feature Subsets

Vincenzo Lagani, Giorgos Athineou|arXiv (Cornell University)|Nov 10, 2016
Gene expression and cancer classification被引用数 8
ひとこと要約

本稿では、RパッケージMXMに実装されたSES(Statistically Equivalent Signatures)アルゴリズムを紹介する。この手法は、複数の統計的に同等の予測特徴サブセットを特定し、単一サブセットの特徴選択法よりもより頑健で解釈可能な代替手法を提供する。予測精度においてLASSOと同等またはそれを上回りつつ、より少ない数の特徴を選び、実世界のデータに自然に存在する複数の同等の予測シグネチャが存在することを示している。

ABSTRACT

The statistically equivalent signature (SES) algorithm is a method for feature selection inspired by the principles of constrained-based learning of Bayesian Networks. Most of the currently available feature-selection methods return only a single subset of features, supposedly the one with the highest predictive power. We argue that in several domains multiple subsets can achieve close to maximal predictive accuracy, and that arbitrarily providing only one has several drawbacks. The SES method attempts to identify multiple, predictive feature subsets whose performances are statistically equivalent. Under that respect SES subsumes and extends previous feature selection algorithms, like the max-min parent children algorithm. SES is implemented in an homonym function included in the R package MXM, standing for mens ex machina, meaning 'mind from the machine' in Latin. The MXM implementation of SES handles several data-analysis tasks, namely classification, regression and survival analysis. In this paper we present the SES algorithm, its implementation, and provide examples of use of the SES function in R. Furthermore, we analyze three publicly available data sets to illustrate the equivalence of the signatures retrieved by SES and to contrast SES against the state-of-the-art feature selection method LASSO. Our results provide initial evidence that the two methods perform comparably well in terms of predictive accuracy and that multiple, equally predictive signatures are actually present in real world data.

研究の動機と目的

  • 既存の特徴選択手法が単一のサブセットしか返さないという限界に対処すること。これは、複数のサブセットがしばしば同等に予測可能であるにもかかわらずである。
  • 最大の予測力を持つ、複数の統計的に同等の最小サイズの特徴サブセットを特定する手法を開発すること。
  • 分類、回帰、生存分析の分野で利用可能なオープンソースRパッケージMXMにSESアルゴリズムを実装すること。
  • 実世界のデータに複数の同等のシグネチャが実際に存在することを経験的に検証し、SESがそれらを信頼性高く回収できることを示すこと。
  • LASSOという最先端の特徴選択手法と比較して、SESの予測性能、安定性、および特徴セットのサイズについて評価すること。

提案手法

  • SESアルゴリズムは、ベイジアンネットワーク構造同定にインspiredされた制約ベース学習の原則を用いて、統計的に同等の特徴サブセットを特定する。
  • 条件付き独立性検定を適用し、目的変数を予測する際にどの特徴が相互に交換可能であるかを同定する。
  • 予測性能が統計的に区別できない最小の特徴集合(シグネチャ)を同定する。
  • MXMパッケージは、さまざまなデータタイプに対応する複数の条件付き独立性検定を用いてSESを実装している。
  • 実世界のデータセットにアルゴリズムを適用し、分類、回帰、生存分析の各タスクにおいて複数のシグネチャを回収・比較する。
  • 予測精度、選択された変数の数、データ分割ごとの安定性の観点から性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1実世界のデータセットに、同等の予測力を持つ複数の統計的に同等の特徴サブセットが自然に存在するか?
  • RQ2SESアルゴリズムは、異なるデータタイプやタスクにおいて、これらの同等のシグネチャを信頼性高く同定・回収できるか?
  • RQ3LASSOという最先端の特徴選択手法と比較して、SESの予測性能はどの程度か?
  • RQ4LASSOと比較して、SESはデータ分割ごとの選択された特徴数の観点でより安定性があるか?
  • RQ5SESが回収したシグネチャは、サンプルサイズの制限による統計的区別不能性の結果であるか、それともデータの内在的冗長性を反映しているか?

主な発見

  • 解析した3つの実世界データセットすべてにおいて、一貫して複数の統計的に同等の予測特徴サブセットが同定された。これは、実際の応用においてこのような同等性が一般的に存在することを示している。
  • SESが回収したシグネチャの予測性能は、すべてのデータセットで非常に近い値を示し、平均標準偏差が2.0未満であった。これにより、それらのシグネチャの統計的同等性が確認された。
  • 乳がんデータセットでは、SESが平均13.29個の特徴を選択(StD: 5.91)、LASSOは平均10.62個(StD: 15.43)を選択した。SESのほうがはるかに高い安定性を示した。
  • AquaticToxデータセットでは、SESが平均5.68個の特徴(StD: 1.80)を選択したが、LASSOは平均160.75個(StD: 66.34)を選択した。SESの優れた単純性(parsimony)が示された。
  • 乳がんデータセットではLASSOがわずかにSESを上回ったが、SESははるかに少ない特徴で同等の性能を達成した。これは、精度とモデルの単純さのトレードオフを示している。
  • 結果から、SESはより単純で、データ構造の隠れた同等性を明らかにすることで、LASSOと同等の予測精度を維持しながら、より深い洞察を提供できることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。