Skip to main content
QUICK REVIEW

[論文レビュー] Understanding a Version of Multivariate Symmetric Uncertainty to assist in Feature Selection

Gustavo Sosa-Cabrera, Miguel García-Torres|arXiv (Cornell University)|Sep 25, 2017
Data Mining Algorithms and Applications参考文献 5被引用数 4
ひとこと要約

本稿は、特徴選択における多次元対称不確実性(MSU)測度のバイアスを調査し、単変量および多次元の順序数、ならびにサンプルサイズがMSUの信頼性に顕著に影響することを特定した。本稿では、バイアスを制御し、非情報的または重複する属性を含む高次元データセットで情報的特徴の正確な検出を保証するための経験則を提案する。その経験則は、サンプルサイズ ≈ 10 × |class| × ∏|fi| である。

ABSTRACT

In this paper, we analyze the behavior of the multivariate symmetric uncertainty (MSU) measure through the use of statistical simulation techniques under various mixes of informative and non-informative randomly generated features. Experiments show how the number of attributes, their cardinalities, and the sample size affect the MSU. We discovered a condition that preserves good quality in the MSU under different combinations of these three factors, providing a new useful criterion to help drive the process of dimension reduction.

研究の動機と目的

  • 高次元データセットにおける特徴選択の際、多次元対称不確実性(MSU)に生じるバイアスを分析すること。
  • 単変量および多次元の順序数、ならびにサンプルサイズが、MSUが情報的特徴と非情報的特徴を区別する能力に与える影響を特定すること。
  • MSUに基づく特徴選択におけるバイアスを最小限に抑えるための実用的なサンプルサイズの基準を策定すること。
  • さまざまな順序数と特徴数の組み合わせにおいて、モンテカルロシミュレーションを通じて提案基準を検証すること。

提案手法

  • 研究では、既知の情報的および非情報的特徴を有する人工データセットを生成するためにモンテカルロシミュレーションを用いた。
  • MSUは、式:MSU(X₁:n) = (n/(n−1)) × [C(X₁:n) / ΣH(Xi)] により評価され、ここでCは全相関、Hはエントロピーを表す。
  • 単変量順序数は、特徴内の異なるラベルの数として定義される。多次元順序数は、クラスを含む特徴間のラベルの組み合わせ数を表す。
  • 著者らは、固定サンプルサイズと計算されたサンプルサイズの両方におけるMSU値を比較し、サンプルサイズ ≈ 10 × |class| × ∏|fi| というルールを用いた。
  • シミュレーションでは、クラスの順序数(2から10)、特徴の順序数(2から64)、およびサンプルサイズ(1000から5000)を変化させ、情報的および非情報的特徴におけるMSUの挙動を評価した。
  • 分析は、非情報的特徴におけるMSUのバイアスの検出に焦点を当て、真の相互作用の検出性能の評価も行った。

実験結果

リサーチクエスチョン

  • RQ1単変量および多次元の順序数は、非情報的特徴におけるMSUのバイアスにどのように影響するか?
  • RQ2さまざまな順序数と特徴数の組み合わせにおいて、MSUの信頼性を保証するためのサンプルサイズはどの程度か?
  • RQ3低順序数の特徴を多く持つことは、少ない高順序数の特徴と同等のMSU値をもたらすか?
  • RQ4サンプルサイズを変化させた場合、特徴が相互作用する(例:XOR型の関係)とMSUはどのように振る舞うか?
  • RQ5多次元順序数と関連づけることで、サンプルサイズを調整することによりMSUバイアスを制御するルールを導出できるか?

主な発見

  • 非情報的特徴のMSU値は、単変量および多次元順序数が高くなるにつれて上昇し、測定値に顕著なバイアスがあることを示している。
  • サンプルサイズが多次元順序数のおよそ10倍(すなわち10 × |class| × ∏|fi|)である場合、MSUはバイアスが制御され、信頼性の高い性能を示す。
  • 非情報的特徴において、単変量順序数が上昇すると、MSU値は急激に上昇し、特にサンプルサイズが固定されている場合に顕著である。
  • サンプルサイズが固定されている場合(例:1000)、非情報的特徴のMSU値は、真の相関が存在しない状況でも、単変量順序数が上昇するにつれて一貫して高くなる。
  • 提案されたルール(サンプルサイズ ≈ 10 × |class| × ∏|fi|)は、特に多くの低順序数特徴を含む高次元設定において、バイアスを効果的に抑制する。
  • サンプルサイズが不十分な場合、高順序数特徴のMSU性能は劣化するが、このルールを適用することで著しく向上する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。