Skip to main content
QUICK REVIEW

[論文レビュー] The art of BART: Minimax optimality over nonhomogeneous smoothness in high dimension

Seonghyun Jeong, Veronika Ročková|arXiv (Cornell University)|Aug 15, 2020
Statistical Methods and Inference被引用数 4
ひとこと要約

本稿は、高次元関数推定における非定常・非等方的滑らかさおよび不連続性の下で、ベイジアン加法的回帰木(BART)のミニマックス最適性を確立する。著者らは、スパースな区分的非一様非等方的ホルダー関数の新クラスを導入し、ディリクレ部分集合選択事前分布を活用することで、等方性や一様性の仮定を必要とせず、BARTが最適な事後収縮率を達成することを証明した。これは、複雑な現実世界の状況において、ガウス過程や他の一般的な機械学習ツールを凌駕する。

ABSTRACT

Many asymptotically minimax procedures for function estimation often rely on somewhat arbitrary and restrictive assumptions such as isotropy or spatial homogeneity. This work enhances the theoretical understanding of Bayesian additive regression trees under substantially relaxed smoothness assumptions. We provide a comprehensive study of asymptotic optimality and posterior contraction of Bayesian forests when the regression function has anisotropic smoothness that possibly varies over the function domain. The regression function can also be possibly discontinuous. We introduce a new class of sparse {\em piecewise heterogeneous anisotropic} Hölder functions and derive their minimax lower bound of estimation in high-dimensional scenarios under the $L_2$-loss. We then find that the Bayesian tree priors, coupled with a Dirichlet subset selection prior for sparse estimation in high-dimensional scenarios, adapt to unknown heterogeneous smoothness, discontinuity, and sparsity. These results show that Bayesian forests are uniquely suited for more general estimation problems that would render other default machine learning tools, such as Gaussian processes, suboptimal. Our numerical study shows that Bayesian forests often outperform other competitors such as random forests and deep neural networks, which are believed to work well for discontinuous or complicated smooth functions. Beyond nonparametric regression, we also examined posterior contraction of Bayesian forests for density estimation and binary classification using the technique developed in this study.

研究の動機と目的

  • 滑らかさの仮定を緩和した状況下でのベイジアンフォレストの性能を分析することで、理論的ギャップを埋めること。特に、非等方的かつ非一様滑らかさに注目する。
  • 制限的な等方性や一様性に基づく従来の漸近的ミニマックス理論と、空間的に変化する滑らかさを示す現実世界のデータとの乖離を是正すること。
  • 区分的で不均一かつ非等方的滑らかさを有し、不連続性を許容する関数クラスを新たに開発し、より現実的な非パラメトリック関数推定を可能にすること。
  • ディリクレ部分集合選択事前分布を用いたBARTが、この一般関数クラス全域でミニマックス最適なレートで事後収縮を達成することを証明すること。
  • 理論的結果を回帰を超えて密度推定および二値分類に拡張し、フレームワークの広範な適用可能性を示すこと。

提案手法

  • 各長方形サブドメインに固有の非等方的滑らかさレベルを持つ、区分的不均一非等方的ホルダー関数の新クラスを導入する。滑らかさは領域間で変化し得るほか、不連続性を許容する。
  • この新関数クラスにおける高次元設定下での$L_2$-損失の下でのミニマックス下界を導出し、最適性の理論的ベンチマークを確立する。
  • 木の分割にディリクレ事前分布を、回帰係数にスパース部分集合選択事前分布を適用し、未知の滑らかさおよび不連続性への適応性とスパarsityを誘導する。
  • 事後収縮理論を用いて、滑らかさが空間的に変動し、事前に未知であっても、BARTの事後分布がミニマックスレートに集中することを示す。
  • ディリクレ過程のスティック・ブレーキング表現を活用し、スパース回復の確率を上界で抑え、事前分布が低次元で関連のある特徴を好むことを保証する。
  • 集中不等式およびガンマ関数の性質、特に高次元における小さな集中パラメータの下での性質を用いて、事後収縮の理論的境界を確立する。

実験結果

リサーチクエスチョン

  • RQ1ベイジアンフォレストは、高次元回帰における非一様・非等方的滑らかさの下でもミニマックス最適推定レートを達成できるか?
  • RQ2回帰関数が入力空間の異なる領域で不連続性や滑らかさの違いを示す場合、BARTはどのように動作するか?
  • RQ3スパースで不均一かつ非等方的滑らかさを有する一般関数クラスに対して、BARTの事後収縮率がミニマックス下界と一致することは証明できるか?
  • RQ4木ベースの事前分布とディリクレ部分集合選択の組み合わせにより、事前に知識がなくてもスパarsity、不連続性、不均一滑らかさの推定が適応的に可能になるか?
  • RQ5理論的結果は回帰を超えて、密度推定および二値分類へどの程度拡張可能か?

主な発見

  • 本稿は、不連続性を許容する新規の区分的不均一非等方的ホルダー関数クラスにおける、高次元非パラメトリック回帰の$L_2$-リスクに対するミニマックス下界を確立した。
  • ディリクレ部分集合選択事前分布を用いたBARTは、滑らかさが領域や方向で変動しても、ミニマックス最適なレートで事後収縮を達成する。
  • 真の関数$\eta^*$の$\epsilon$-近傍内にいる事後確率は、$\exp\{-C\xi s\log(p/\epsilon)\}$より大きい下限で抑えられ、効果的な集中が確認された。
  • 事前分布は、$s$個を超える変数が活性化される構成に対して指数的に小さい確率を割り当てることでスパarsityを保証する。$\Pi(\min_{|S|=s} \sum_{j\notin S} \eta_j \geq \epsilon) \leq \exp\{-C(\xi-1)s\log p - \log \epsilon\}$。
  • 理論的結果は、BARTが未知の滑らかさ、不連続性、スパarsityを調整可能であり、チューニングなしに、ガウス過程や他の一般的な機械学習ツールを上回ることを示した。
  • 数値実験により、BARTが不連続性や極めて不均一な滑らかさを示す関数を推定する際、ランダムフォレストや深層ニューラルネットワークを上回ることを確認し、理論的主張を実証的に裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。