Skip to main content
QUICK REVIEW

[論文レビュー] Grouped variable importance with random forests and application to multiple functional data analysis

Baptiste Gregorutti, Bertrand Michel|HAL (Le Centre pour la Communication Scientifique Directe)|Nov 15, 2014
Statistical Methods and Inference被引用数 12
ひとこと要約

本稿は、関数データ解析に特化したランダムフォレストのグループ化された変数重要度測度を導入し、ウェーブレット係数をグループ化することで、関数的変数全体の選択を可能にする。この手法は航空安全データに適用され、加法的モデルにおける理論的裏付けのもと、効率的なグループワイズ特徴選択を用いて、着陸距離の予測精度が向上することを示している。

ABSTRACT

The selection of grouped variables using the random forest algorithm is considered. First a new importance measure adapted for groups of variables is proposed. Theoretical insights into this criterion are given for additive regression models. Second, an original method for selecting functional variables based on the grouped variable importance measure is developed. Using a wavelet basis, it is proposed to regroup all of the wavelet coefficients for a given functional variable and use a wrapper selection algorithm with these groups. Various other groupings which take advantage of the frequency and time localization of the wavelet basis are proposed. An extensive simulation study is performed to illustrate the use of the grouped importance measure in this context. The method is applied to a real life problem coming from aviation safety.

研究の動機と目的

  • 変数のグループ化に関する事前知識を考慮した、ランダムフォレストの新しいグループ化された変数重要度測度を開発すること。
  • 予測変数が時間的関数として与えられる複数関数データ解析(FDA)において、関数的予測変数を選択する課題に取り組むこと。
  • 個々の係数ではなく関数的変数全体を選択することで、予測精度の向上とモデルの解釈可能性の向上を図ること。
  • 本手法を実世界の航空安全データに適用し、飛行パラメータに基づく着陸距離の予測に特化すること。
  • 加法的回帰モデル下でのグループ化された重要度測度の理論的洞察を提供すること。

提案手法

  • ランダムフォレストにおける袋だ出誤差への影響を評価するグループ化されたパーミュテーション重要度測度を提案し、関数的変数のすべてのウェーブレット係数を含む変数グループ全体を削除した際の影響を測定する。
  • 関数的予測変数をウェーブレット基底分解で表現し、関数的変数ごと、または周波数/時間局在化に基づいて自然な係数グループ化を可能にする。
  • グループ化された重要度に従って誘導されるラッパー型の再帰的特徴削除(RFE)アルゴリズムを適用し、順次重要度が低いグループを削除する。
  • カイ二乗分布の偏差境界に基づくハードスレッショルドルールを導入し、高い確率で真の信号サポートを回復することを目的とする。
  • ドノホとジョンストーンのソフトスレッショルドリング法の修正版を適応し、ノイズレベル(σ)の推定にMAD推定法を用い、適応的スレッショルドを適用する。
  • 潜在変数モデルを用いて関数的回帰フレームワークを一般化し、異なる条件下での信号構造の非一様性を許容する。

実験結果

リサーチクエスチョン

  • RQ1変数が自然にグループ化されている(例:関数的予測変数のウェーブレット係数)場合、ランダムフォレストにおける変数重要度をどのように意味的にグループ化に拡張できるか。
  • RQ2特に加法的回帰モデルにおいて、グループ化された重要度測度がどのような理論的性質を有するか。
  • RQ3個々の係数選択と比較して、グループ化された変数重要度が複数関数データ解析における特徴選択と予測精度を向上させるか。
  • RQ4本手法は、航空安全分野において、長距離着陸を予測するための関連する飛行パラメータを効果的に特定できるか。
  • RQ5ウェーブレットに基づくグループ化(例:レベル別、時間周波数局在化)は、関数データ設定におけるランダムフォレストモデルの性能を向上させることができるか。

主な発見

  • グループ化された変数重要度測度は、個々の重要度の和に還元されず、特に非加法的モデルでは顕著に異なる場合がある。
  • 加法的回帰モデルにおいて、本稿ではグループ化された重要度の正確な分解を導出しており、その使用に対する理論的裏付けを提供する。
  • スレッショルドルールを用いることで、真の信号サポートの回復確率が高く達成され、x = 2 log(N) のとき確率的境界が O(1/N) に保証される。
  • シミュレーションスタディにより、グループベースの選択が個々の係数選択よりも、予測精度と安定性の面で優れていることが確認された。
  • 実世界の航空安全忢用において、本手法は着陸距離に影響を与える主要な飛行パラメータを効果的に同定し、実用的有用性を示した。
  • δ²_{N,n} = σ²(4 log(N) + 2√(2n log(N)) + n) であるスレッショルドルールにより、ゼロ信号の誤検出確率が O(1/N) に抑えられ、一貫性のある回復を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。