Skip to main content
QUICK REVIEW

[論文レビュー] Soft Gradient Boosting Machine

Ji Feng, Yi-Xuan Xu|arXiv (Cornell University)|Jun 7, 2020
Face and Expression Recognition参考文献 31被引用数 9
ひとこと要約

本稿では、ソフト勾配ブースティングマシン(sGBM)を提案する。sGBMは、ベースラーナーの逐次学習を、局所的およびグローバル損失目的関数を用いた並列最適化に置き換える、微分可能で統合最適化可能なアンサンブルモデルである。微分可能なソフトディシジョンツリーをベースラーナーとして採用することで、XGBoostなどの従来の勾配ブースティングマシンと比較して、10倍以上の高速化、より高い精度、およびオンライン学習や知識蒸留における優れた性能を達成した。

ABSTRACT

Gradient Boosting Machine has proven to be one successful function approximator and has been widely used in a variety of areas. However, since the training procedure of each base learner has to take the sequential order, it is infeasible to parallelize the training process among base learners for speed-up. In addition, under online or incremental learning settings, GBMs achieved sub-optimal performance due to the fact that the previously trained base learners can not adapt with the environment once trained. In this work, we propose the soft Gradient Boosting Machine (sGBM) by wiring multiple differentiable base learners together, by injecting both local and global objectives inspired from gradient boosting, all base learners can then be jointly optimized with linear speed-up. When using differentiable soft decision trees as base learner, such device can be regarded as an alternative version of the (hard) gradient boosting decision trees with extra benefits. Experimental results showed that, sGBM enjoys much higher time efficiency with better accuracy, given the same base learner in both on-line and off-line settings.

研究の動機と目的

  • 従来の勾配ブースティングマシン(GBM)における逐次的学習のボトルネックを解消し、並列化とスケーラビリティを向上させること。
  • 以前に学習されたベースラーナーが新しいデータに適応できない従来のGBM型モデルにおけるオンラインおよびインクリメンタル学習を可能にすること。
  • ハードディシジョンツリーに基づくGBMの代替として微分可能であることを実現し、統合最適化と階層的表現学習を可能にするモデルを開発すること。
  • ベースラーナー間のより豊かな相互作用を可能にすることで、多出力回帰および知識蒸留の性能を向上させること。

提案手法

  • sGBMは、有向無閉路グラフ(DAG)構造を用いて、複数の微分可能なベースラーナー(例:ソフトディシジョンツリー)を1つの微分可能なアーキテクチャに接続する。
  • 各ベースラーナーに対して局所的損失を導入し、残差誤差を最小化するとともに、全体のモデル性能を正則化するためのグローバル損失を導入する。
  • 全モデルを確率的勾配降下法(SGD)またはその変種を用いて統合最適化することで、エンドツーエンドの学習と並列化による線形な高速化を実現する。
  • ソフトディシジョンツリーをベースラーナーとして採用することで、ツリー構造を介した勾配の流れを可能にし、微分可能なルーティングおよび分割意思決定を実現する。
  • 学習中にワンホットラベルを密度ベクトルに変換することで、自然に多次元回帰および知識蒸留をサポートする。
  • 学習率や重み減衰などのハイパーパrameterは検証を用いて調整され、実験ではAdam最適化手法が用いられた。

実験結果

リサーチクエスチョン

  • RQ1微分可能で統合最適化可能なアンサンブルモデルは、従来の逐次的GBMを上回る学習速度と精度を達成できるか?
  • RQ2ソフトGBMフレームワークは、再学習を必要とせずに新しいデータバッチに適応できる有効なオンライン/インクリメンタル学習をサポートできるか?
  • RQ3sGBMは、特にソフトラベル分布の転送を行う場合に、深層ニューラルネットワークからの知識蒸留を効果的に実行できるか?
  • RQ4sGBMにおける微分可能なベースラーナー間の相互作用は、標準的なアンサンブル手法やハードGBMと比較して、モデル容量および一般化性能においてどのように異なるか?

主な発見

  • sGBMは、同じベースラーナーを用いた場合、XGBoostと比較して10倍以上の学習時間の高速化を達成し、すべてのベンチマークデータセットでより高いテスト精度を達成した。
  • 多出力回帰タスクでは、sGBDT(sGBMのツリー型バージョン)がXGBoost-MOを上回り、平均二乗誤差が低かった(例:scm1dでは0.0981 ± 0.0014 vs. 0.1302 ± 0.0045)。
  • インクリメンタル学習では、sGBDTはXGBoostよりも速く収束し、データバッチの経過とともに性能低下が小さく、より高い精度を維持した。
  • sGBDTはCNNから知識を効果的に蒸留し、MNISTでは97.57%のテスト精度を達成した(XGBoostでは94.61%、蒸留なし)。XGBoostはソフトラベルを使用した場合、性能が低下した。
  • ソフトディシジョンツリーの使用により、多次元出力の自然な取り扱いとベースラーナー間の相互作用の向上が可能になり、一般化性能および蒸留能力が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。