Skip to main content
QUICK REVIEW

[論文レビュー] The Tree Ensemble Layer: Differentiability meets Conditional Computation

Hussein Hazimeh, Natalia Ponomareva|arXiv (Cornell University)|Feb 18, 2020
Advanced Neural Network Applications参考文献 25被引用数 16
ひとこと要約

本稿では、微分可能で、スパースで滑らかなステップ関数を用いた活性化関数と最適化された前向き/後向き伝搬を備えた、ニューラルネットワークにおける微分可能な決定木ベースのレイヤーであるTree Ensemble Layer(TEL)を提案する。TELは真の条件付き計算を可能にし、先行研究の微分可能な木と比較して10倍以上の高速化を達成するとともに、勾配ブースティング木と比較して20倍のモデルサイズ削減を実現しながら、競争力のある性能を維持する。また、深層とワイドな木アンサンブルの共同最適化を可能にする。

ABSTRACT

Neural networks and tree ensembles are state-of-the-art learners, each with its unique statistical and computational advantages. We aim to combine these advantages by introducing a new layer for neural networks, composed of an ensemble of differentiable decision trees (a.k.a. soft trees). While differentiable trees demonstrate promising results in the literature, they are typically slow in training and inference as they do not support conditional computation. We mitigate this issue by introducing a new sparse activation function for sample routing, and implement true conditional computation by developing specialized forward and backward propagation algorithms that exploit sparsity. Our efficient algorithms pave the way for jointly training over deep and wide tree ensembles using first-order methods (e.g., SGD). Experiments on 23 classification datasets indicate over 10x speed-ups compared to the differentiable trees used in the literature and over 20x reduction in the number of parameters compared to gradient boosted trees, while maintaining competitive performance. Moreover, experiments on CIFAR, MNIST, and Fashion MNIST indicate that replacing dense layers in CNNs with our tree layer reduces the test loss by 7-53% and the number of parameters by 8x. We provide an open-source TensorFlow implementation with a Keras API.

研究の動機と目的

  • 微分可能な決定木を深層アーキテクチャ内に統合し、エンドツーエンドの学習を可能にすることで、ニューラルネットワークと木アンサンブルの長所を融合すること。
  • 既存の微分可能な木の計算非効率性を解消するため、スパースルーティングを用いた真の条件付き計算を導入すること。
  • 勾配ブースティング木におけるグリーディで段階的な学習の制限を克服し、SGDなどの一次の最適化手法を用いて深層とワイドな木アンサンブルを共同最適化すること。
  • 特に画像認識およびテーブルデータ学習タスクにおいて、予測性能を損なわず、モデルサイズの削減と推論効率の向上を実現すること。

提案手法

  • 決定木によるスパースでサンプル固有のルーティングを可能にする新規な滑らかなステップ活性化関数を提案し、古典的決定木の挙動を模倣する。
  • スパarsityを活用した特殊な前向きおよび後向き伝搬アルゴリズムを設計し、最適な時間計算量を達成する。後向き伝搬の計算量は木の深さに依存しない。
  • 勾配ベース最適化を用いてニューラルネットワークの残りの部分とエンドツーエンドで学習可能な、微分可能なソフトツリーのアンサンブル(別名ソフトツリー)を導入する。
  • SGDなどの一次の最適化手法を用いて、アンサンブル内のすべての木の内部ノードの意思決定とリーフ重みを同時に更新することで、コンactかつ表現力のあるモデルを実現する。
  • CNNを含むニューラルネットワークに統合可能なプラグインレイヤーとしてTELを実装し、実用的導入を可能にするKeras互換のTensorFlow APIを提供する。
  • 各入力サンプルが木アーキテクチャの小さなサブセットのみを通過できる微分可能なルーティング機構を採用し、条件付き計算を実現する。

実験結果

リサーチクエスチョン

  • RQ1真の条件付き計算を用いることで、微分可能な決定木を深層ニューラルネットワーク内での共同最適化に十分に効率化できるか?
  • RQ2微分可能な木に条件付き計算を導入することで、従来の手法と比較してトレーニングおよび推論の高速化が顕著に達成できるか?
  • RQ3一次の最適化手法(例:SGD)を用いて深層とワイドな木アンサンブルを共同最適化することで、段階的学習に依存する勾配ブースティング木よりも、よりコンactかつ正確なモデルが得られるか?
  • RQ4TELをCNNの全結合層に置き換えることで、パrameter数を削減し、テスト損失を改善できる程度はどの程度か?
  • RQ5TELと勾配ブースティング木の間で、木の数といったハイパーパrameterへのモデル性能の感受性はどのように異なるか?

主な発見

  • 23個の分類データセットにおいて、効率的なスパースルーティングと最適化されたバックプロパゲーションのおかげで、TELは既存の微分可能な木手法と比較してトレーニングおよび推論で10倍以上の高速化を達成した。
  • 同じデータセットにおいて、TELは勾配ブースティング木と比較してモデルサイズを20倍以上削減したが、AUC性能は競争力を持って維持された。
  • Pima、Heart-C、Spambaseのデータセットでは、TELは5本の木でピークAUCに到達したが、GBDTは同等の性能を得るためには100本以上が必要だった。これは、より優れたコンパクト性を示している。
  • CNNにおいて、全結合層をTELに置き換えることで、CIFAR-10、MNIST、Fashion-MNISTでテスト損失が7〜53%低下し、モデルパラメータ数は約8倍削減された。CIFARおよびFashion-MNISTでは統計的に有意な改善が得られた。
  • TELはGBDTと比較して、木の数に対するモデル性能の感受性が低く、共同最適化下でもより安定的かつ頑健な学習が可能であることが示された。
  • Keras APIを備えたオープンソースのTensorFlow実装により、テーブルデータおよびビジョンタスクの両方における深層学習パイプラインへのTELの実用的統合が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。