Skip to main content
QUICK REVIEW

[論文レビュー] Transformation Forests

Torsten Hothorn, Achim Zeileis|arXiv (Cornell University)|Jan 9, 2017
Machine Learning and Data Classification参考文献 43被引用数 10
ひとこと要約

この論文では、変換関数によって定義されるパラメトリック分布族を用いて条件付き分布をモデル化する、新たなランダムフォレスト手法「変換フォレスト(transformation forests)」を紹介する。変換木(変動の兆候である分散のシフトなどの分布的変化を検出することを目的とした木構造)とフォレストベースの集約を組み合わせることで、予測区間、変数重要度、ブートストラップ分散推定を含む柔軟でモデルに基づく推論が可能となり、従来のランダムフォレストよりも非平均ベースの不均一性を検出する性能に優れる。

ABSTRACT

Regression models for supervised learning problems with a continuous target are commonly understood as models for the conditional mean of the target given predictors. This notion is simple and therefore appealing for interpretation and visualisation. Information about the whole underlying conditional distribution is, however, not available from these models. A more general understanding of regression models as models for conditional distributions allows much broader inference from such models, for example the computation of prediction intervals. Several random forest-type algorithms aim at estimating conditional distributions, most prominently quantile regression forests (Meinshausen, 2006, JMLR). We propose a novel approach based on a parametric family of distributions characterised by their transformation function. A dedicated novel "transformation tree" algorithm able to detect distributional changes is developed. Based on these transformation trees, we introduce "transformation forests" as an adaptive local likelihood estimator of conditional distribution functions. The resulting models are fully parametric yet very general and allow broad inference procedures, such as the model-based bootstrap, to be applied in a straightforward way.

研究の動機と目的

  • 標準的なランダムフォレストが条件付き平均しかモデル化しないという限界に対処し、分散のシフトなどの分布的変化を検出できないことの是正。
  • 予測子に基づく応答変数の完全な条件付き分布をモデル化する手法の開発により、予測区間や分位数推定などのより豊かな推論を可能にすること。
  • パラメトリック分布族におけるパrameterの安定性を評価することで、分布的変化(例:分散の変化)を検出できる「変換木(transformation trees)」の導入。
  • ランダムフォレストを完全にパラメトリックなフレームワークに拡張し、モデルベースのブートストラップ、尤度比検定、条件付き変数重要度の評価を可能にすること。
  • 一元的な変換モデルフレームワーク下で、右打ち切り・左打ち切りデータを含む多様な応答タイプの柔軟なモデリングを可能にすること。

提案手法

  • 本手法は、応答変数を位置・スケール族に写像する変換関数によって特徴づけられるパラメトリック分布族を用い、条件付き分布の柔軟なモデリングを可能にする。
  • 尤度比検定を用いて変換モデルの適合を改善する分割を検出する、新規な「変換木(transformation tree)」アルゴリズムを提案。分散やスケールの変化を検出するにあたり、分散分析(ANOVA)やログランク基準に依存するのではなく、尤度の改善に基づく分割基準を採用。
  • 変換フォレストは、複数の変換木を集約し、各木は末端ノードにおける最尤推定により条件付き分布のパラメータを推定する。
  • 予測は、重み付き経験分布関数に基づく。重みは、木構造における近接性、具体的には同じ末端ノードを共有する観測値の頻度から導出される。
  • 尤度に基づく変数重要度と、変動性および有意性の評価に適したモデルベースのブートストラップをフレームワークがサポートする。
  • ノード共有に基づく単純な近傍重みに代えて、末端ノードにおける推定分布パラメータ間の距離(例:Kullback-Leibler情報量)を用いた代替重み付けスキームを提案。これにより、ノード共有以外の近接性評価が向上する。

実験結果

リサーチクエスチョン

  • RQ1ランダムフォレストフレームワークを、平均のみではなく応答変数の完全な条件付き分布をモデル化できるように拡張することは可能か?
  • RQ2木ベースの手法は、位置の変化(平均)のみに反応するのではなく、分散やスケールの変化といった分布的変化をどのように検出できるか?
  • RQ3変換フォレストは、分位数回帰フォレストなどの既存手法に比べ、条件付き分位数や予測区間の推定をより正確にできるか?
  • RQ4分布的不均一性を捉えることで、変数重要度の評価がどの程度向上するか?
  • RQ5モデルベースの推論(例:ブートストラップ、尤度比検定)を完全にパラメトリックなフォレストフレームワークに適用し、堅牢な統計的推論を可能にする方法は何か?

主な発見

  • 従来の分位数回帰フォレストが平均指向の分割基準に依存するため、一様な予測子において分散シフトを検出できないのに対し、変換フォレストは、.5 の位置で分散シフトを明確に検出できた。
  • 変換木アルゴリズムは、分散変化などの非位置ベースの不均一性を検出する力が、分散分析(ANOVA)やログランク基準に依存する従来手法よりも優れている。従来手法は、平均やハザードの変化にのみ敏感である。
  • 条件付き分布全体をモデル化することで、条件付き分位数や予測区間の推定が、条件付き平均のモデル化のみに依存する従来手法よりも正確に可能となった。
  • モデルベースのブートストラップと尤度比検定が、変換フォレストフレームワーク内で実現可能であり、パラメータの安定性や変数重要度に関する推論が可能となった。
  • 一元的なパラメトリック変換モデルフレームワーク下で、右打ち切り・左打ち切りデータを含む多様な応答タイプをサポートする。
  • 末端ノードにおける分布パラメータ間のKullback-Leibler情報量に基づく代替重み付けスキームにより、従来の木ベースのフォレストにおける単純な近傍重みに比べ、近接性推定が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。