Skip to main content
QUICK REVIEW

[論文レビュー] Unbiased Measurement of Feature Importance in Tree-Based Methods

Zhengze Zhou, Giles Hooker|arXiv (Cornell University)|Mar 12, 2019
Statistical Methods and Inference参考文献 42被引用数 17
ひとこと要約

本稿では、連続変数や高基数のカテゴリカル変数のような、より多くの分割が可能な特徴量に偏りが生じる伝統的な分割改善(ジニ重要度)の内在的バイアスを補正するため、不参加データにおける分割改善スコアを用いた不偏な特徴量重要度測定法を提案する。この手法により、連続または高基数のカテゴリカル特徴量に対する誤った重要度が低減され、帰無仮説下でも不偏推定が保証され、計算コストは最小限に抑えられ、scikit-learn や randomForest などの既存ライブラリへの統合も容易である。

ABSTRACT

We propose a modification that corrects for split-improvement variable importance measures in Random Forests and other tree-based methods. These methods have been shown to be biased towards increasing the importance of features with more potential splits. We show that by appropriately incorporating split-improvement as measured on out of sample data, this bias can be corrected yielding better summaries and screening tools.

研究の動機と目的

  • 連続変数や高基数のカテゴリカル変数のような、より多くの分割が可能な特徴量に偏向する、既に広く知られている分割改善特徴量重要度測定法のバイアスを是正すること。
  • 不参加データを用いて分割改善を推定することで、訓練データへの過剰適合を避ける、シンプルで計算効率の良い修正法を開発すること。
  • scikit-learn や randomForest などの人気ライブラリで現在使用されているバイアスを含むインサンプル測定法の理論的裏付けのある不偏代替法を提供すること。
  • シミュレーションおよび実世界のデータセットを用いた実証的検証を通じて、特徴量スクリーニングおよびランク付けにおける信頼性の向上を示すこと。
  • 予測力のない特徴量が期待的に重要度ゼロとなるようにすることで、より信頼できるモデル解釈性と後続分析を可能にすること。

提案手法

  • インサンプルの分割改善を不参加データにおける分割改善に置き換えることで、過剰適合を回避する。
  • ランダムフォレスト内の各木について、分割における不純度低減の改善度は、木を構築した際に使用した訓練セットではなく、不参加サンプル上で測定される。
  • 最終的な特徴量重要度は、すべての木およびすべての分割におけるこれらの不参加データ上での分割改善値の平均値として得られ、不偏推定が保証される。
  • 既存の木生成フレームワークと互換性があり、分割改善の集約方法を変更するのみで、最小限のコード変更で実装可能である。
  • 不正直な木やクロスバリデーション、ホールドアウトパーティションなど自然なテストセットが得られる設定にも拡張可能である。
  • 理論的裏付けとして、帰無仮説(予測力なし)下で期待重要度がゼロになることを示している。

実験結果

リサーチクエスチョン

  • RQ1ランダムフォレストにおける標準的な分割改善測定法は、分割が可能な回数が多い特徴量(特に連続変数や高基数カテゴリカル変数)に系統的なバイアスを示すか?
  • RQ2不参加データにおける分割改善推定は、このバイアスを是正し、より信頼性の高い特徴量重要度ランク付けを可能にするか?
  • RQ3提案手法の不偏測定法は、パーサーメーション重要度や cforest といった既存手法と比較して、実世界およびシミュレーションデータでどのように性能を発揮するか?
  • RQ4提案手法は、バイナリ、カテゴリカル、連続変数など、さまざまな特徴量タイプに対して頑健か?
  • RQ5不偏測定法は、仮説検定や信頼区間といった形式的統計的推論を木ベースのモデルで可能にするか?

主な発見

  • ランダムフォレストにおける標準的な分割改善測定法は、連続変数や高基数カテゴリカル変数のような、分割が可能な回数が多い特徴量に顕著なバイアスを示す。
  • 10個のノイズ特徴量を含むシミュレーションでは、提案手法の不偏特徴量重要度(UFI)は真の予測変数を正しく特定したが、標準的な分割改善(SI)はノイズ特徴量をより高い順位にランク付けした。
  • AdultおよびBoston Housingデータセットにおいて、UFIはSIよりもより現実的かつ一貫性のある特徴量ランク付けを実現し、ランダム特徴量の重要度はほぼゼロとなった。
  • UFIの重要度スコアは、最先端の2つの手法、cforest および ranger と整合的であり、強い実証的妥当性を示している。
  • 不参加サンプルはランダムフォレストで既に利用可能であるため、標準的な学習に追加コストを要せず、計算コストは最小限に抑えられる。
  • 理論的分析により、予測力のない特徴量が期待的に重要度ゼロとなることが確認され、不偏性が満たされている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。