Skip to main content
QUICK REVIEW

[論文レビュー] A Rigorous Information-Theoretic Definition of Redundancy and Relevancy in Feature Selection Based on (Partial) Information Decomposition

Patricia Wollstadt, Sebastian Schmitt|arXiv (Cornell University)|May 10, 2021
Neural Networks and Applications被引用数 9
ひとこと要約

本稿は、部分的情報分解(PID)を用いた情報理論的枠組みを導入し、特徴選択における冗長性と関連性を、固有の寄与、重複する寄与、協同的寄与の観点から厳密に定義する。CMIに基づく反復的前向き選択アルゴリズムを提案し、冗長性を最小限に抑え、関連性を最大化する。ベンチマークデータセットにおいて、統計的に妥当な停止基準を用いて優れた性能を示している。

ABSTRACT

Selecting a minimal feature set that is maximally informative about a target variable is a central task in machine learning and statistics. Information theory provides a powerful framework for formulating feature selection algorithms -- yet, a rigorous, information-theoretic definition of feature relevancy, which accounts for feature interactions such as redundant and synergistic contributions, is still missing. We argue that this lack is inherent to classical information theory which does not provide measures to decompose the information a set of variables provides about a target into unique, redundant, and synergistic contributions. Such a decomposition has been introduced only recently by the partial information decomposition (PID) framework. Using PID, we clarify why feature selection is a conceptually difficult problem when approached using information theory and provide a novel definition of feature relevancy and redundancy in PID terms. From this definition, we show that the conditional mutual information (CMI) maximizes relevancy while minimizing redundancy and propose an iterative, CMI-based algorithm for practical feature selection. We demonstrate the power of our CMI-based algorithm in comparison to the unconditional mutual information on benchmark examples and provide corresponding PID estimates to highlight how PID allows to quantify information contribution of features and their interactions in feature-selection problems.

研究の動機と目的

  • 特徴選択における情報理論的枠組みにおいて、特徴の関連性、冗長性、協同的寄与を厳密に定義する概念的ギャップを解消すること。
  • 従来の情報理論的特徴選択手法が特徴間の相互作用を十分に捉えていない理由を明確にすること。
  • 部分的情報分解(PID)を用いて、情報理論的に根拠を持つ関連性と冗長性の新しい定義を提案すること。
  • 統計的有意性検定を用いた自動停止が可能な、実用的で反復的なCMIベースの前向き特徴選択アルゴリズムを提案すること。
  • 提案アルゴリズムの有効性をベンチマークデータセットで示し、MIベースおよびモデルベースの手法(LARS、ランダムフォレスト)と比較すること。

提案手法

  • 特徴集合が目的変数に関して提供する情報を、固有の寄与、重複する寄与、協同的寄与に分解するため、部分的情報分解(PID)を用いる。
  • 特徴の関連性を、固有の寄与と協同的寄与の最大化および重複寄与の最小化として定義する。
  • 条件付き相互情報量(CMI)に基づく反復的前向き選択アルゴリズムを提案し、現在の特徴集合に対してCMIが最大となる特徴を逐次追加する。
  • ノンパラメトリックな統計的検定手順を用い、サーヴィレートデータを用いてCMIの有意性を評価し、最大統計量法により家族ワイズ誤差率を制御する。
  • サーヴィレートCMI推定値の最小値を用いたバックワード除去ステップを適用し、最小特徴集合の選択を保証する。
  • パーミュテーションに基づくサーヴィレートデータ生成法を用い、周辺分布を保持すると同時に、帰無仮説下で結合依存関係を破壊する。

実験結果

リサーチクエスチョン

  • RQ1情報理論を用いて、特徴選択における冗長性と関連性をどのように厳密に定義できるか?
  • RQ2古典的な情報理論的アプローチがなぜ特徴間の協同的および重複的相互作用を捉えていないのか?
  • RQ3CMIベースの特徴選択アルゴリズムは、冗長性を明示的に最小化することで、MIベースの手法を上回ることができるか?
  • RQ4提案されたアルゴリズムは、最小かつ統計的に有意な特徴集合をどのように保証するか?
  • RQ5PIDベースの指標は、特徴の固有的、重複的、協同的寄与という異なる役割をどれくらい正確に定量化できるか?

主な発見

  • N=1000のサンプルサイズで50個の変数を持つ問題において、CMIベースのアルゴリズムは10個中5個の関連特徴を正しく同定した。N=50,000の大きなサンプルサイズでは、10個中9個の関連特徴を同定した。
  • 小さなサンプルサイズ(N=100)では、統計的パワーが不十分なために早期に停止し、偽陰性率が高くなったが、偽陽性率は0.05の有意水準を下回った。
  • サーヴィレートデータと最大統計量法の組み合わせにより、逐次的特徴選択における複数検定反復の家族ワイズ誤差率が効果的に制御された。
  • PID推定値は、CMIベースの選択が情報原子を一度しかカバーしないことを示しており、重複カバーを回避し、高次の相互作用を捉えることを可能にした。
  • CMIベースの手法は、特に重複的または協同的な特徴相互作用が存在する状況において、無条件相互情報量(MI)を常に上回って関連特徴を同定した。
  • アルゴリズムは大規模問題においても頑健で信頼性が高く、サンプルサイズが増加するにつれて性能が著しく向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。