Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian and empirical Bayesian forests

Matt Taddy, Chunsheng Chen|arXiv (Cornell University)|Feb 8, 2015
Bayesian Modeling and Causal Inference参考文献 23被引用数 18
ひとこと要約

本稿では、ベイジアンフォレスト(BF)と経験的ベイジアンフォレスト(EBF)を導入し、ランダムフォレストを非パラメトリックベイジアンモデルからの事後分布サンプルとして定式化することで、解釈可能性と安定性を向上させる。EBFは、最初に浅いCARTの幹をフィットさせ、その後各枝でフォレストの構築を並列化することで、大規模データにスケーラブルに適用可能であり、完全なベイジアンフォレストと比較して予測性能が2%以内に収まり、サブサンプリング手法よりも誤差率で最大38%優れている。

ABSTRACT

We derive ensembles of decision trees through a nonparametric Bayesian model, allowing us to view random forests as samples from a posterior distribution. This insight provides large gains in interpretability, and motivates a class of Bayesian forest (BF) algorithms that yield small but reliable performance gains. Based on the BF framework, we are able to show that high-level tree hierarchy is stable in large samples. This leads to an empirical Bayesian forest (EBF) algorithm for building approximate BFs on massive distributed datasets and we show that EBFs outperform sub-sampling based alternatives by a large margin.

研究の動機と目的

  • ランダムフォレストの理解と改善のための非パラメトリックベイジアンフレームワークを構築し、木構造上の事後サンプリングを可能にする。
  • 特に大規模標本において、非パラメトリックベイジアンDGPからの繰り返しサンプリングにおけるCART木の安定性を分析する。
  • 大規模分散データセット上で近似ベイジアンフォレストを構築するための効率的でスケーラブルなアルゴリズム—経験的ベイジアンフォレスト(EBF)—を設計する。
  • 複数の実世界データセットにおいて、EBFがサブサンプリングに基づく分散フォレスト手法よりも予測精度で顕著に優れていることを実証する。
  • 計算リソースをモデルの最も情報量の多い部分に集中させることで、大規模データ環境における信頼性の高い高パフォーマンスな木のアンサンブル学習を可能にする。

提案手法

  • 有限サポート上にディリクレ-多項分布の事前分布を用いて、データ生成プロセス(DGP)の非パラメトリックベイジアンモデルを形式化し、木構造上の事後分布サンプリングを可能にする。
  • DGPの事後分布からCART木をサンプリングするベイジアンフォレスト(BF)アルゴリズムを導出する。ランダムフォレストは、この分布の頻度的近似とみなす。
  • 木の安定性に関する理論的境界を確立する:事後DGPの実現が標本CARTの分割と一致する確率は、1 − (p / √n) e^−n よりも大きく、大規模標本では上位の木構造が非常に安定していることを示す。
  • 事後モード(全データに対する1回のCARTフィットにより得られる)で木の幹構造を固定し、その後各枝で独立してフォレストをサンプリングする経験的ベイジアンフォレスト(EBF)を提案する。
  • Apache Sparkなどの分散コンピューティングフレームワークを活用し、各枝でEBFを並列にフィットさせ、通信量を最小限に抑えながらスケーラビリティを最大化する。
  • 最小リーフサイズと幹の深さを調整パラメータとして用い、計算コストと予測性能のバランスを取る。

実験結果

リサーチクエスチョン

  • RQ1ランダムフォレストは、データ生成プロセスの非パラメトリックベイジアンモデルからの近似事後サンプルとして解釈可能か?
  • RQ2特に大規模標本において、CART木は、潜在的なDGPの異なる実現に対してどれほど安定しているか?
  • RQ31つの幹をフィットさせた後、各枝で独立してフォレストを構築する二段階アプローチは、大規模データ上で完全なベイジアンフォレストと同等の予測性能を達成できるか?
  • RQ4予測精度とスケーラビリティの観点から、EBFの性能はサブサンプリングに基づく分散フォレスト手法と比べてどうか?
  • RQ5EBFにおいて、幹の深さ、枝のサイズ、予測誤差の間にはどのようなトレードオフがあるか?

主な発見

  • カリフォルニア住宅価格データセットでは、EBFの予測性能は完全なベイジアンフォレスト(BF)と2%以内に収まり、サブサンプリングフォレスト(SSF)は10%劣っている。
  • ワインの品質データセットでは、EBFはBFと1%以内に近く、SSFは決定的誤差(RMSE)で12%劣っている。
  • ビールブランド選好予測タスクでは、EBFはBFより4.4%劣るが、SSFは誤分類率で38%も劣っている。
  • EBFの性能は最小リーフサイズの変更に対しても安定しており、リーフサイズを半分にした場合、誤差は最大7.6%までしか増加しない。一方、決定木では29.5%の増加を示した。
  • eBayの1200万件の取引レコードにおいて、EBFはSSFより誤分類誤差を1.3%低減し、20,000件以上の追加の悪意ある取引体験を検出できた。
  • 理論的分析により、大規模標本下での上位木構造の安定性が確認され、分割一致確率が1 − (p / √n) e^−n よりも大きく、EBFアプローチの妥当性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。