[論文レビュー] Deep Embedding Forest: Forest-based Serving with Deep Embedding Features
本稿では、深層ニューラルネットワーク(DNN)の埋め込み層と木ベースのモデル(例:XGBoost、LightGBM)を組み合わせたハイブリッドモデルであるDeep Embedding Forestを提案する。この手法により、DNN並みの性能を達成しつつ、フォレスト並みの推論速度を実現する。高次元特徴を低次元ベクトルにマップする埋め込み層を学習し、高速な推論を実現する木のアンサンブルを用いることで、DNNの推論時間の数分のの一程度にまで短縮される。大規模なスポンサーリンク検索データ上でも、近似的に最適な精度を維持する。
Deep Neural Networks (DNN) have demonstrated superior ability to extract high level embedding vectors from low level features. Despite the success, the serving time is still the bottleneck due to expensive run-time computation of multiple layers of dense matrices. GPGPU, FPGA, or ASIC-based serving systems require additional hardware that are not in the mainstream design of most commercial applications. In contrast, tree or forest-based models are widely adopted because of low serving cost, but heavily depend on carefully engineered features. This work proposes a Deep Embedding Forest model that benefits from the best of both worlds. The model consists of a number of embedding layers and a forest/tree layer. The former maps high dimensional (hundreds of thousands to millions) and heterogeneous low-level features to the lower dimensional (thousands) vectors, and the latter ensures fast serving. Built on top of a representative DNN model called Deep Crossing, and two forest/tree-based models including XGBoost and LightGBM, a two-step Deep Embedding Forest algorithm is demonstrated to achieve on-par or slightly better performance as compared with the DNN counterpart, with only a fraction of serving time on conventional hardware. After comparing with a joint optimization algorithm called partial fuzzification, also proposed in this paper, it is concluded that the two-step Deep Embedding Forest has achieved near optimal performance. Experiments based on large scale data sets (up to 1 billion samples) from a major sponsored search engine proves the efficacy of the proposed model.
研究の動機と目的
- 生産環境における深層ニューラルネットワーク(DNN)の高い推論コストを解消すること。
- 高次元かつ多様な特徴に対して、膨大な手作業の特徴工学的処理を必要とする木ベースのモデルの限界を克服すること。
- DNNによる自動特徴抽出と、木モデルによる低コスト推論を活用するハイブリッドアーキテクチャを構築すること。
- 専用アクセラレータ(例:GPU、FPGA)を必要とせず、標準的なCPUハードウェア上で効率的かつスケーラブルな推論を可能にすること。
- 2段階の学習戦略が、共同最適化と比較してほぼ最適な性能を達成できることを示すこと。
提案手法
- 本モデルは、Deep Crossingに基づくDNNバックボーンを用い、テキストやカテゴリカル変数などの高次元かつ多様な特徴から、低次元の密な埋め込みを学習する。
- 埋め込み層の出力を、木ベースのモデル(例:XGBoostやLightGBM)に供給し、決定経路を通じて高速な推論を実現する。
- 2段階の学習プロセスを採用:最初に、事前学習済みDNN重みを用いて埋め込み層を初期化し、次に埋め込み特徴に基づいて木層を学習する。
- 勾配逆伝播を用いて、木のパラメータと埋め込み表現を同時に最適化するための、部分的ファジフィケーションと呼ばれる共同最適化技術を導入する。
- 木の内部ノードでは、シグモイドベースのルーティング関数を用いて、左または右に進む確率を決定する微分可能で柔らかく分割するメカニズムを採用し、木構造内での勾配伝播を可能にする。
- 最終的な予測は、リーフノード出力の重み付き和として計算され、最終確率を得るためにシグモイド関数を用いてスコアが変換される。
実験結果
リサーチクエスチョン
- RQ1DNNと木ベースのモデルをハイブリッド化したモデルは、DNN並みの性能を達成しつつ、木モデル並みの低コスト推論を実現できるか?
- RQ2このハイブリッド環境下で、2段階の学習戦略は、エンドツーエンドの共同最適化と比較してどの程度効果的か?
- RQ3手作業の特徴工学的処理を一切行わずに、DNNで学習された埋め込み特徴が、木ベースのモデルの性能をどの程度向上できるか?
- RQ4提案手法は10億サンプル規模のデータセットにスケーリング可能であり、標準的なCPUハードウェア上で低遅延推論を維持できるか?
- RQ5部分的ファジフィケーションアルゴリズムは、他の共同最適化手法と比較して収束性および最終的な性能において優れているか?
主な発見
- 2段階のDeep Embedding Forest手法は、大規模なスポンサーリンク検索データ上において、完全なDNNベースラインと同等またはわずかに優れた性能を達成した。
- 推論時間はDNNモデルの数分のの一にまで短縮され、標準的なCPUハードウェア上でもほぼ木モデル並みの推論速度を実現した。
- 本モデルは強力なスケーラビリティを示し、最大10億件のサンプルを含むデータセットの学習および推論に成功した。
- 部分的ファジフィケーションによる共同最適化手法は、ほぼ最適な性能に収束し、2段階アプローチの有効性を裏付けた。
- XGBoostやLightGBMを含むさまざまな木ベースのバックボーンに対して、本モデルは高い性能を維持しており、モデル選択に対して頑健であることが示された。
- 微分可能で柔らかい分割の採用により、木構造内での有効な逆伝播が可能となり、埋め込み表現と木のパラメータの両方の共同最適化が実現された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。