Skip to main content
QUICK REVIEW

[論文レビュー] Variable Selection with Copula Entropy

Jian Ma|arXiv (Cornell University)|Oct 28, 2019
Spectroscopy and Chemometric Analyses参考文献 31被引用数 15
ひとこと要約

本稿では、応答変数との依存度に基づいて予測子をランク付け・選択するモデルフリーでチューニングフリーな変数選択手法を提案する。この手法は、距離相関、HSIC、ステップワイズ選択、正則化モデルなどの従来手法を凌駕し、特にUCIの心疾患データセットにおいて、予測精度を損なわずに関連性があり解釈可能な変数を選択できる。

ABSTRACT

Variable selection is of significant importance for classification and regression tasks in machine learning and statistical applications where both predictability and explainability are needed. In this paper, a Copula Entropy (CE) based method for variable selection which use CE based ranks to select variables is proposed. The method is both model-free and tuning-free. Comparison experiments between the proposed method and traditional variable selection methods, such as Distance Correlation, Hilbert-Schmidt Independence Criterion, Stepwise Selection, regularized generalized linear models and Adaptive LASSO, were conducted on the UCI heart disease data. Experimental results show that CE based method can select the `right' variables out more effectively and derive better interpretable results than traditional methods do without sacrificing accuracy performance. It is believed that CE based variable selection can help to build more explainable models.

研究の動機と目的

  • 従来の相関ベースの手法が失敗する高次元で非線形的かつ非正規分布のデータにおいて、関連する予測子を選択する課題に対処すること。
  • パラメトリックな仮定やハイパーパrameterチューニングに依存しない、モデルフリーかつチューニングフリーな変数選択手法を開発すること。
  • 情報理論に根ざした統計的意味のある依存度測度に基づいて、変数選択を実施することで、モデルの解釈性を向上させること。
  • 距離相関、HSIC、AIC/BICを用いたステップワイズ選択、正則化モデルなどの既存手法を上回り、臨床的に関連性のある変数を効果的に選択すること。
  • コプシラ・エントロピー(CE)を、原理的で公理的かつ物理的に解釈可能な測度として、実世界の応用における変数選択に用いる基盤を確立すること。

提案手法

  • 本手法は、各予測子と応答変数の間の依存度測度としてコプシラ・エントロピー(CE)を用い、単調変換に対して不変であるように統計的依存度を定量化する。
  • CE値に基づいて変数をランク付けし、高いCE値を示すほど応答変数との依存度が強く、したがって関連性が高いと判断する。
  • 本手法はモデルフリーである。これは、予測子と応答変数の間の関係に特定のパラメトリックな形を仮定しないことを意味する。
  • 本手法はチューニングフリーである。LASSO やリッジ回帰とは異なり、正則化強度などのハイパーパrameter は必要としない。
  • 本手法はエントロピーの公理的性質(単調変換に対して不変であること、ガウス分布仮定下で一貫した振る舞いを示すこと)を活用する。
  • 変数選択は、CE値が上位の変数を選び、応答変数との依存度を最大にするサブセットを形成することで実施する。

実験結果

リサーチクエスチョン

  • RQ1コプシラ・エントロピー(CE)は、従来の依存度測度の代替として信頼性があり、モデルフリーかつチューニングフリーであると言えるか?
  • RQ2CEに基づく変数選択は、距離相関、HSIC、AIC/BIC、正則化モデルといった従来手法と比較して、予測精度および選択効率においてどのように差を示すか?
  • RQ3CEに基づく選択は、他の手法と比較してより解釈可能で臨床的に意味のある変数サブセットを生成するか?
  • RQ4CEは、dCor や dHSIC と比較して、実世界のデータにおける非線形的・非正規的依存度をどの程度優れて捉えられるか?
  • RQ5CEに基づく選択は、スパarsity やモデルの正しさといった制限的な仮定に依存せずに、より優れた性能を達成できるか?

主な発見

  • CEに基づく手法は、UCIの心疾患データセットにおいて、臨床的に認識された予測子と非常に整合性の高い変数を選択し、強い解釈性を示した。
  • 本手法は距離相関やHSICよりも選択精度および予測性能で優れており、意味のある非線形的依存度を検出する能力に優れたCEの特徴を示した。
  • AIC/BICを用いたステップワイズ選択と比較して、CE手法はより関連性の高い変数を選択し、モデル誤指定や近似バイアスの問題を回避できた。
  • オラクル性を持つ適応的LASSOでさえ、CE手法よりも少ない変数を選択したが、CE手法は追加の血管関連特徴など、追加の臨床的に意味のある予測子を捉えていた。
  • CEに基づくモデルは、すべてのベースライン手法と同等またはそれ以上の予測精度を達成しながら、統計的依存度に基づいたより解釈可能な変数サブセットを提供した。
  • 結果から、CEに基づく変数選択は、パラメトリックな仮定や正則化のチューニングに依存する手法よりも、より頑健で普遍的に適用可能なことが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。