Skip to main content
QUICK REVIEW

[論文レビュー] Exact Distributed Training: Random Forest with Billions of Examples

Mathieu Guillame-Bert, Olivier Teytaud|arXiv (Cornell University)|Apr 18, 2018
Machine Learning and Data Classification参考文献 6被引用数 4
ひとこと要約

本稿では、近似を用いず、最大180億件の例を含むデータセットに対して正確にランダムフォレストを学習する分散アルゴリズムDRFを提案する。深さレベルごとに処理を行うワーカー基盤のアーキテクチャにより、メモリ、ディスク、ネットワークのオーバーヘッドを最小限に抑える。本手法は、最新のスケーラビリティを達成し、173億件の例を用いた木の学習を22時間で実行した。また、10億例を超える規模ですでにモデル性能が向上を続けることが実証された。

ABSTRACT

We introduce an exact distributed algorithm to train Random Forest models as well as other decision forest models without relying on approximating best split search. We explain the proposed algorithm and compare it to related approaches for various complexity measures (time, ram, disk, and network complexity analysis). We report its running performances on artificial and real-world datasets of up to 18 billions examples. This figure is several orders of magnitude larger than datasets tackled in the existing literature. Finally, we empirically show that Random Forest benefits from being trained on more data, even in the case of already gigantic datasets. Given a dataset with 17.3B examples with 82 features (3 numerical, other categorical with high arity), our implementation trains a tree in 22h.

研究の動機と目的

  • スプリット選択における近似を回避する分散的かつ正確なランダムフォレスト学習アルゴリズムの開発。
  • 100億例を超えるデータセットへのランダムフォレスト学習の拡張を実現し、従来の正確および近似手法を上回るスケーラビリティを達成。
  • 分散学習中のRAM、ディスクI/O、ネットワークトラフィック、CPU使用量の計算複雑度を最小限に抑える。
  • ランダムフォレストが100億例規模のデータでもさらに大きなデータ量にさらされると性能向上を示すことを実証的に検証。
  • 分散型特徴量重要度の計算と、勾配ブースティングツリー風の共依存木モデルのサポートを可能にする。

提案手法

  • アルゴリズムは木を深さレベルごとに処理し、データセットの列をワーカーに分散して、グローバルなデータアクセスを回避する。
  • ワーカーは決定論的な擬似乱数生成器を用いて、ノード間のバギングサンプルをネットワーク通信なしに同期する。
  • 各サンプルのリーフへの割り当てを、リーフ数ℓの⌈log₂ℓ⌉ビットで表すビットベクターマッピングを用いる。
  • スプリット候補はスプリッターワーカーが並列に評価し、それぞれが特徴のサブセットを処理する。木ビルダーはノードのスプリットと木構造の調整を統括する。
  • マネージャーは木ビルダーを調整し、最終的なモデルを集約し、標準的なランダムフォレストと完全に等価であることを保証する。
  • 大規模データセットの数値特徴量には外部ソーティングを用い、データをワーカー間でパーティショニングして逐次アクセスを可能にする。

実験結果

リサーチクエスチョン

  • RQ1近似を用いず、100億例を超えるデータセットに対して正確な分散型ランダムフォレストアルゴリズムをスケーリング可能か?
  • RQ2より大きなデータセット(例:173億例)で学習させることで、小規模なスケールで観察されたものよりモデル性能が向上するか?
  • RQ3提案手法DRFは、メモリ、ディスク、ネットワークの複雑度において、従来の正確手法(Sliq, Sprint)と比較してどの程度優れているか?
  • RQ4AUCなどのモデル指標は、データセットサイズや木の深さが増すにつれてどの程度向上を続けるか?
  • RQ5正確なフレームワーク内で、分散型特徴量重要度と共依存木学習(例:XGBoost風)を効率的にサポートできるか?

主な発見

  • DRFは、82の特徴量(うち3つが数値型、残りは高基数のカテゴリカル特徴)を有する173億例のデータセットを22時間で正確にランダムフォレストで学習し、スケール記録を樹立した。
  • 173億例の全データセットに対してAUCは0.847を達成し、深さ20においても性能向上が継続していることから、学習能力の飽和は見られなかった。
  • 深さ20において、173億例のデータセットの96.9%のサンプルが開いているリーフに残存していたため、プルーニングによる高速化は顕著ではなかった。
  • 個々の木における過学習は、1%のデータでは深さ13で発生したが、100%のデータでは深さ17で発生したため、大規模スケールでもより深い木が実用可能であることが示された。
  • 深さ20におけるノード密度(0.415)とサンプル密度(0.969)は、高深度であっても木構造が効率的かつデータが豊富に保持されていることを示している。
  • 本手法は、空間的・ディスク的・ネットワーク的複雑度において、従来の正確手法を上回り、分散型特徴量重要度計算もサポートしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。