Skip to main content
QUICK REVIEW

[論文レビュー] CO2 Forest: Improved Random Forest by Continuous Optimization of Oblique Splits

Mohammad Norouzi, Maxwell D. Collins|arXiv (Cornell University)|Jun 19, 2015
Neural Networks and Applications参考文献 24被引用数 5
ひとこと要約

CO2 Forest は、分類損失の凸-凹上界を用いた連続的最適化により、特徴量の線形結合(傾斜付き分割)をとる新たなランダムフォレストアルゴリズムを提案する。この手法により、確率的勾配降下法が効率的に適用可能となり、標準的なランダムフォレストや既存の傾斜付き木手法よりも優れた性能を示し、多クラスベンチマークおよび LFW 顔分類タスクで最先端の性能を達成した。最大1000本の木を用いることができる。

ABSTRACT

We propose a novel algorithm for optimizing multivariate linear threshold functions as split functions of decision trees to create improved Random Forest classifiers. Standard tree induction methods resort to sampling and exhaustive search to find good univariate split functions. In contrast, our method computes a linear combination of the features at each node, and optimizes the parameters of the linear combination (oblique) split functions by adopting a variant of latent variable SVM formulation. We develop a convex-concave upper bound on the classification loss for a one-level decision tree, and optimize the bound by stochastic gradient descent at each internal node of the tree. Forests of up to 1000 Continuously Optimized Oblique (CO2) decision trees are created, which significantly outperform Random Forest with univariate splits and previous techniques for constructing oblique trees. Experimental results are reported on multi-class classification benchmarks and on Labeled Faces in the Wild (LFW) dataset.

研究の動機と目的

  • 標準的なランダムフォレストにおける一変量分割の制限を解消し、計算効率は保ちつつも判別力の向上を図ること。
  • 従来の分割基準(例:ジニ係数、情報利得)の微分不能性および不連続性に起因する、傾斜付き分割における数値最適化の困難さを克服すること。
  • 多次元線形しきい値関数の最適化を可能にする、連続的かつ微分可能な代替損失関数を構築すること。
  • 最適化を施しても木のアンサンブルにおける多様性を維持し、ランダムフォレストの文脈で頑健な一般化性能を確保すること。
  • コンピュータビジョンや機械学習で一般的な高次元・大規模データセットにも、傾斜付き木の学習をスケーラブルに拡張できること。

提案手法

  • 1段階の意思決定木に対して、ラムプ関数に類似した損失関数を用いて、経験的分類損失の連続的上界を定式化する。
  • 分割関数を特徴量の線形結合(傾斜付き分割)としてモデル化し、確率的勾配降下法によりパラメータを最適化する。
  • 上界の凸-凸差(DC)分解を最適化するために、凸-凸プロセス(CCCP)を用いる。
  • 局所最適解を避けるために、多様性を促進するため、ランダムフォレストからの分割関数を初期値として用いる。
  • 1000本までの CO2 樹木を含むフォレストを訓練し、各木を独立に連続的上界と SGD を用いて最適化する。
  • 上界に任意の凸損失関数を用いることで、多クラス分類、回帰、構造予測への一般化を実現する。

実験結果

リサーチクエスチョン

  • RQ1不連続な傾斜付き意思決定木分割最適化の目的関数に対して、連続的かつ微分可能な代替損失関数を構築可能か?
  • RQ2高次元特徴空間における全探索やランダムサンプリングと比較して、傾斜付き分割の連続的最適化が、より優れた一般化性能をもたらすか?
  • RQ3ランダムフォレストフレームワーク内で結合された最適化済みの傾斜付き木が、十分な多様性を維持できるか?
  • RQ4大規模・高次元データセットにおいて、CO2 Forest は標準的なランダムフォレストや OC1 と比較して、精度とスケーラビリティの面で優れているか?
  • RQ5提案手法は、複雑な特徴工学を伴わず、実世界のビジョンタスク(例:顔の部位分類)で最先端の性能を達成できるか?

主な発見

  • CO2 Forest は、テストした9つの多クラス分類ベンチマークすべてで標準的なランダムフォレストを上回り、一貫した精度向上を示した。
  • Labeled Faces in the Wild(LFW)データセットにおいて、32本の木を用いた場合、CO2 Forest はテスト時の Jaccard スコア 42.55 を達成し、ランダムフォレスト(34.61)と Two-probe Forest(38.61)を大きく上回った。
  • 16本の木を用いた場合、ハイパーパramータ η=10⁻⁴ および ν=1 をグリッドサーチで選択し、検証時の Jaccard スコア 41.87 を達成した。
  • 高次元入力(例:2883次元の画像ウィンドウ)および大規模なトレーニングセット(256,000個のサブウィンドウ)に対しても、スケーラブルに効果的に動作した。
  • 木の数が増加しても、CO2 Forest は高い性能を維持した。これは、ランダムフォレストからの初期化により最適化がアンサンブルの多様性を損なわないことを示している。
  • 凸損失関数を上界に一般化することで、回帰や構造予測など他のタスクにも応用可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。