[論文レビュー] Bayesian Regression Tree Ensembles that Adapt to Smoothness and Sparsity
本稿では、未知の滑らかさとスパarsityを高次元回帰において適応する、新たなベイジアンツリーエンsemble手法であるSoft Bayesian Additive Regression Trees (SBART)を提案する。スパarsity誘導型の事前分布を用いたソフトデシジョンツリーを採用することで、予測子の数がサンプルサイズに対してほぼ指数関数的に増加する場合でさえも、スパースで滑らかで加法的な関数に対して近似的にミニマックスに近い事後分布収縮率を達成する。また、既存のBARTアルゴリズムに対する変更を最小限に抑えることができる。
Ensembles of decision trees are a useful tool for obtaining for obtaining flexible estimates of regression functions. Examples of these methods include gradient boosted decision trees, random forests, and Bayesian CART. Two potential shortcomings of tree ensembles are their lack of smoothness and vulnerability to the curse of dimensionality. We show that these issues can be overcome by instead considering sparsity inducing soft decision trees in which the decisions are treated as probabilistic. We implement this in the context of the Bayesian additive regression trees framework, and illustrate its promising performance through testing on benchmark datasets. We provide strong theoretical support for our methodology by showing that the posterior distribution concentrates at the minimax rate (up-to a logarithmic factor) for sparse functions and functions with additive structures in the high-dimensional regime where the dimensionality of the covariate space is allowed to grow near exponentially in the sample size. Our method also adapts to the unknown smoothness and sparsity levels, and can be implemented by making minimal modifications to existing BART algorithms.
研究の動機と目的
- 従来のベイジアンツリーエンsembleが未知の滑らかさに適応できないことや、次元の呪いに苦しむという限界を解消すること。
- 高次元設定下でスパースで滑らかな回帰関数に対して最適な事後分布収縮率を達成する手法を開発すること。
- 最小限の対数要因を除きミニマックスレートに一致する事後集中の理論的保証を提供すること。
- 既存のBARTアルゴリズムへの最小限の変更で実装可能でありながら、理論的最適性を維持すること。
- 事前にこれらの特徴を知らなくても、未知の滑らかさ、スパarsity、および低次の相互作用構造に適応できることを示すこと。
提案手法
- スプリットが決定的ではなく確率的であるソフトデシジョンツリーを導入することで、滑らかな関数推定が可能になる。
- スプリットルール確率にスパarsity誘導型のディリクレ事前分布を適用し、活性な予測子が少ないモデルを優遇する。
- BARTフレームワーク内に和のツリー加法的構造を採用することで、柔軟で非パラメトリックな関数推定が可能になる。
- 和のツリー推定子とカーネル型推定子との関係を結ぶ重要な補題を適用し、事後集中の理論的分析を可能にする。
- 標準的なBARTギブスサンプリングおよびバックフィットティングアルゴリズムに対するわずかな変更で、手法を実装する。
- ディリクレ事前分布の条件付き共役性を活用し、MCMCサンプリング中の計算の扱いやすさを維持する。
実験結果
リサーチクエスチョン
- RQ1ベイジアンツリーエンsembleは、真の回帰関数の未知の滑らかさレベルに適応できるか?
- RQ2ソフトデシジョンツリーにおけるスパarsity誘導型事前分布は、高次元回帰における次元の呪いを緩和できるか?
- RQ3高次元漸近的条件下で、ベイジアンツリーエンsembleの事後分布は近似的にミニマックスレートに収縮するか?
- RQ4構造に関する事前の知識がなくても、加法的または低次の相互作用構造に適応できるか?
- RQ5提案手法は、既存のBARTアルゴリズムへの最小限の変更で実装可能であり、理論的最適性を維持できるか?
主な発見
- SBARTは、$ d \ll p $ 個の活性な予測子を持つ関数に対して、$ n^{-\frac{\bar{\nu}}{2\bar{\nu}+d}} + \sqrt{n^{-1}d\log p} $ のレートで事後分布収縮を達成する。これは、$ p $ が $ n $ に対してほぼ指数関数的に増加する場合でも、近似的にミニマックス最適である。
- $ \alpha $-ホルダー滑らか関数に対しては、最小限の対数要因を除き、ミニマックスレート $ n^{-\frac{\alpha}{2\alpha + p}} $ で事後分布が収縮する。
- 真の関数が $ V $ 個の成分から成り、各成分が $ d_v $ 個の予測子に依存し、$ \alpha_v $-滑らかである加法的構造を持つ場合、SBARTは $ \sum_{v=1}^V \varepsilon_{n,v} $ のレートを達成する。ここで $ \varepsilon_{n,v} = n^{-\frac{\alpha_v}{2\alpha_v + d_v}}(\log n)^{t_v} + \sqrt{n^{-1}d_v\log p} $ であり、これは近似的にミニマックス最適である。
- 本手法は、これらの特徴に関する事前の知識がなくても、未知の滑らかさ、スパarsity、および相互作用次数に適応する。
- 事前分布集中確率は $ \exp\{-C n \varepsilon_n^2\} $ で下限が保証され、提示されたレート下で事後一様性が支持される。
- 理論的結果は、和のツリー推定子とカーネル型推定子との関係を結ぶ、新たな補題によって裏付けられており、ミニマックスレート分析が可能になる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。