Skip to main content
QUICK REVIEW

[論文レビュー] varrank: an R package for variable ranking based on mutual information with applications to observed systemic datasets

Gilles Kratzer, Reinhard Furrer|arXiv (Cornell University)|Apr 19, 2018
Bayesian Modeling and Causal Inference参考文献 19被引用数 9
ひとこと要約

この論文では、特にmRMReフレームワークを用いた相互情報に基づく手法を用いて、モデルフリーな変数ランク付けを可能にするRパッケージvarrankを紹介する。変数のターゲットセットへの関連性を最大化し、重複を最小化することで、疫学およびそれ以上の分野における高次元のシステム的データセットに対して包括的で、解釈可能かつ計算的に効率的なソリューションを提供する。

ABSTRACT

This article describes the R package varrank. It has a flexible implementation of heuristic approaches which perform variable ranking based on mutual information. The package is particularly suitable for exploring multivariate datasets requiring a holistic analysis. The core functionality is a general implementation of the minimum redundancy maximum relevance (mRMRe) model. This approach is based on information theory metrics. It is compatible with discrete and continuous data which are discretised using a large choice of possible rules. The two main problems that can be addressed by this package are the selection of the most representative variables for modeling a collection of variables of interest, i.e., dimension reduction, and variable ranking with respect to a set of variables of interest.

研究の動機と目的

  • システム疫学および関連分野で一般的な高次元で多次元のデータセットにおける変数選択の課題に対処すること。
  • 任意のしきい値に依存する伝統的な段階的または適合度に基づく変数選択手法とは異なり、柔軟でモデルフリーな代替手法を提供すること。
  • 単一の結果に依存する枠組みを越えて、同時に複数の変数の関心対象を扱える包括的分析を可能にすること。
  • 相互情報や冗長性ペナルティを用いた情報理論的指標を通じて、変数ランク付けの解釈可能性と計算効率を向上させること。
  • 可視化および設定可能なツールを提供することで、専門知識をデータ駆動型選択と統合し、堅牢な変数ランク付けを実現すること。

提案手法

  • ターゲットセットへの関連性と、すでに選択された変数との冗長性のバランスを取るスコアに基づいて変数を選択する、最小冗長最大関連性(mRMRe)モデルを採用する。
  • 変数間の関連性と冗長性を測定するためのコア指標として相互情報(MI)を用い、離散化後に、離散的および連続的データの両方と互換性を持つ。
  • 冗長性ペナルティ項のための4つの異なる正規化戦略(battiti, kwak, peng, esteves)を実装し、それぞれが既知のmRMReアルゴリズムの変種に対応する。
  • 複数のユーザー定義ルールを用いたデータの離散化をサポートし、情報理論的計算における連続変数の堅牢な処理を可能にする。
  • 80%のサンプリングを用いたブートストラップ手順を実装し、サンプルサイズにわたるランク付けの安定性を評価し、並行座標プロットで可視化する。
  • 変数ランク付けとその安定性を視覚化する専用のプロット関数を提供し、探索的データ分析およびモデル解釈を支援する。

実験結果

リサーチクエスチョン

  • RQ1複数の関心対象となる変数が存在する状況において、単一の結果予測に依存せず、モデルフリーで包括的な方法で変数ランク付けをどのように行えるか?
  • RQ2mRMReに基づくアプローチは、高次元データセットにおいて、さまざまなサンプルサイズにわたって変数選択の安定性と一貫性をどの程度向上させるか?
  • RQ3mRMReフレームワークにおける異なる正規化戦略(例:battiti, kwak, peng, esteves)は、変数ランク付けのパフォーマンスと頑健性において、どのように比較されるか?
  • RQ4相互情報に基づくランク付けは、ステップワイズ選択やAIC/BICといった従来の手法に比べ、システム的データセットにおける安定性と関連性の面で優れているか?
  • RQ5varrankパッケージは、システム疫学における専門知識とデータ駆動型変数選択の統合をどのように向上させるか?

主な発見

  • Pima Indians Diabetesデータセットにおいて、varrankパッケージは、80%のブートストラップを用いた場合、上位ランクの変数のうち約25%が再取得されるという強い一貫性を示した。
  • 非常に高い共線形性を示すLongleyデータセットでは、変数ランク付けの一致度が方法によって低下し、特に「Armed.Forces」のランク付けが共線形性に敏感であることが示された。
  • ブートストラップ解析により、特に「glucose」の変数ランク付けがサンプルサイズにかかわらず安定しており、データサブサンプリングとは独立した高い関連性を示した。
  • 変数「pressure」は、95%および90%のブートストラップサンプルで6位に安定してランク付けされたが、これは「mass」、「pedigree」、「age」および「insulin」と比較して中程度ではあるが一貫性に欠ける関連性を示した。
  • 図3の並行座標プロットは、サンプルサイズの増加に伴い、全体的なランク付けパターンが安定しており、一部の変数ではランクの不確実性が低いことを確認した。
  • varrankは、小規模から中規模のデータセットにおいて競争力のある計算パフォーマンスを示し、実世界の実用的応用に適していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。