Skip to main content
QUICK REVIEW

[論文レビュー] Making Sense of Random Forest Probabilities: a Kernel Perspective

Matthew Olson, Abraham J. Wyner|arXiv (Cornell University)|Dec 14, 2018
Neural Networks and Applications参考文献 14被引用数 22
ひとこと要約

本論文は、ランダムフォレストの確率推定にカーネル回帰フレームワークを確立し、木の近接度から導出される近接カーネルがバンド幅パrameterとして機能することを示している。著者らは、このカーネルをモデル化することで、ランダムフォレストの確率推定に原理的で統計的な基盤を提供し、mtryのチューニングがキャリブレーションを著しく向上させることを示している。合成データにおいて、近接度ベースの手法は標準のランダムフォレストよりもRMSEを最大50%まで低減している。

ABSTRACT

A random forest is a popular tool for estimating probabilities in machine learning classification tasks. However, the means by which this is accomplished is unprincipled: one simply counts the fraction of trees in a forest that vote for a certain class. In this paper, we forge a connection between random forests and kernel regression. This places random forest probability estimation on more sound statistical footing. As part of our investigation, we develop a model for the proximity kernel and relate it to the geometry and sparsity of the estimation problem. We also provide intuition and recommendations for tuning a random forest to improve its probability estimates.

研究の動機と目的

  • 投票数によるランダムフォレストの確率推定の非原理的性質に起因する統計的根拠の欠如を是正すること。
  • ランダムフォレストとカーネル回帰の間の明確な接続を確立し、近接カーネルをその背後にあるカーネルとして同定すること。
  • カーネルの形状とmtryに依存するバンド幅の依存関係をモデル化し、チューニングの直感的説明を提供すること。
  • カーネルの視点からランダムフォレストを再解釈し、近接度ベースの推定を提案することで、確率推定の質を向上させること。
  • 近接度ベースの推定が、標準の分類または回帰フォレストよりも顕著に低いRMSEを達成することを実証的に示すこと。

提案手法

  • ランダムフォレストの構造から近接カーネルを導出する。近接度とは、複数の木において2つの訓練点が同じ端末ノードに共起する頻度を測る。
  • mtryを関数として近接カーネルをモデル化し、それがカーネル推定の有効バンド幅を制御することを示す。
  • 近接カーネルを用いたカーネル回帰としてランダムフォレストの確率推定を再定式化し、訓練点からの近接度によって重みが決定される。
  • 投票数を置き換える近接度を類似度測度として用いる確率推定手法$RF^{prox}$を提案する。
  • mtryをチューニングしてカーネルバンド幅を制御し、近接カーネル推定におけるバイアスとバリアンスのトレードオフを調整する。
  • 合成データセットにおけるRMSEを用いて、$RF^{prox}$を標準のランダムフォレスト(分類および回帰モード)、バギング木、完全にランダムなフォレストと比較する。

実験結果

リサーチクエスチョン

  • RQ1ランダムフォレストの確率推定を、カーネル回帰理論に正式に根拠づけるにはどうすればよいか?
  • RQ2mtryは近接カーネルの形状にどのように寄与し、確率推定におけるバイアス・バリアンスのトレードオフを制御するのか?
  • RQ3近接カーネルは、元となるデータの幾何学的性質とスパarsityにどのように関係するか?
  • RQ4近接度ベースの確率推定は、標準の投票数による推定を上回ることができるか?
  • RQ5mtryのチューニング戦略の中で、ランダムフォレストにおける最適な確率キャリブレーションを達成するものは何か?

主な発見

  • ランダムフォレストにおける近接カーネルは、カーネル回帰におけるバンド幅パrameterとして機能し、mtryがカーネルの幅(したがって確率推定の滑らかさ)を制御する。
  • mtry = 1の場合、弱い木と高い相関性により、分類誤差が最適であっても確率推定は0.5に強く偏る。
  • mtry = 30の場合、真の値(0.3および0.7)の周囲に適切に集中した推定が得られ、mtryのチューニングがキャリブレーションにおいて極めて重要であることが示された。
  • $RF^{prox}$は6つの合成モデルのうち4つで最も低いRMSEを達成し、XORおよび1次元モデルでは、次善の手法と比較して誤差を50%まで削減した。
  • 10次元モデルでは、$RF^{prox}$はRMSE 0.396を達成し、次善の手法(0.383)を上回り、高次元設定でも頑健であることが示された。
  • カーネルの視点から、標準のランダムフォレストはベイズ誤差率に達していても、確率推定が著しく劣ることが明らかになった。これは分類性能と確率推定性能の間の乖離を強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。