Skip to main content
QUICK REVIEW

[論文レビュー] Scalable kernel-based variable selection with sparsistency

Xin He, Junhui Wang|arXiv (Cornell University)|Feb 26, 2018
Sparse and Compressive Sensing Techniques被引用数 7
ひとこと要約

本稿では、カーネル回帰と勾配推定の後にハードスレッショルドを適用するスケーラブルでカーネルベースの変数選択手法を提案する。この手法は明示的なモデル仮定を必要とせず、漸近的スパースパーシスティを達成する。任意の再生核ヒルバート空間(RKHS)で動作可能で、一般化された予測子効果を扱い、並列化により次元数に比例してスケーリング可能であり、線形カーネルおよびガウスカーネルに対しても理論的保証が得られる。

ABSTRACT

Variable selection is central to high-dimensional data analysis, and various algorithms have been developed. Ideally, a variable selection algorithm shall be flexible, scalable, and with theoretical guarantee, yet most existing algorithms cannot attain these properties at the same time. In this article, a three-step variable selection algorithm is developed, involving kernel-based estimation of the regression function and its gradient functions as well as a hard thresholding. Its key advantage is that it assumes no explicit model assumption, admits general predictor effects, allows for scalable computation, and attains desirable asymptotic sparsistency. The proposed algorithm can be adapted to any reproducing kernel Hilbert space (RKHS) with different kernel functions, and can be extended to interaction selection with slight modification. Its computational cost is only linear in the data dimension, and can be further improved through parallel computing. The sparsistency of the proposed algorithm is established for general RKHS under mild conditions, including linear and Gaussian kernels as special cases. Its effectiveness is also supported by a variety of simulated and real examples.

研究の動機と目的

  • 高次元設定において柔軟でスケーラブルかつ理論的裏付けのある変数選択アルゴリズムの開発。
  • 予測子効果の一般化を可能にしつつ、明示的なパラメトリックモデル仮定の必要性を排除すること。
  • 多様な再生核ヒルバート空間(RKHS)において、弱い条件下でも漸近的スパースパーシスティを保証すること。
  • 次元数に比例するスケーリングと並列処理のサポートにより、計算の効率化を実現すること。
  • 最小限の修正で相互作用選択に拡張可能となるようにすること。

提案手法

  • 本手法は、再生核ヒルバート空間(RKHS)を用いて回帰関数およびその勾配関数をカーネルベースで推定する。
  • 推定された勾配関数に対してハードスレッショルドを適用し、関連する予測子を同定する。
  • アルゴリズムは線形カーネルおよびガウスカーネルに由来する任意のRKHSに適応可能である。
  • 次元数に比例するスケーリングにより計算効率を達成し、並列計算によりさらに向上させる。
  • 加法的またはパラメトリックな形を仮定せず、予測子効果の非パラメトリックモデリングを可能にする。
  • 勾配推定ステップを変更して対応項効果を含めることで、相互作用選択への拡張が可能である。

実験結果

リサーチクエスチョン

  • RQ1回帰関数の特定のパラメトリックモデルを仮定せずに、変数選択手法がスパースパーシスティを達成できるか。
  • RQ2高次元設定におけるカーネルベース手法をどのように計算的にスケーラブルにできるか。
  • RQ3一般のRKHSにおいて、カーネルベースの変数選択の漸近的スパースパーシスティを保証する条件は何か。
  • RQ4複雑で加法的でない予測子効果を扱いながらも、理論的保証を維持できるか。
  • RQ5この手法は予測子間の相互作用をどの程度検出可能に拡張できるか。

主な発見

  • 提案手法は、線形カーネルおよびガウスカーネルを含む、弱い正則性条件のもとで一般RKHSにおいて漸近的スパースパーシスティを達成する。
  • 真の回帰関数が非パラメトリックであっても、理論的保証付きで一貫した変数選択が可能である。
  • 計算コストは予測子の数に比例して増加し、高次元データの効率的処理が可能である。
  • アルゴリズムは並列処理をサポートしており、大規模データセットにおける実行時間性能がさらに向上する。
  • シミュレーテッドおよび実データからの実験結果は、関連変数の同定において優れた性能を示している。
  • 最小限の修正で相互作用選択に拡張可能であり、理論的および計算的利点を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。