[論文レビュー] HeterPS: Distributed Deep Learning With Reinforcement Learning Based Scheduling in Heterogeneous Environments
HeterPS は、CPU や GPU などの異種コンピューティングリソース上で大規模な DNN のトレーニングを最適化する強化学習(RL)に基づくスケジューリングを用いる分散ディープラーニングフレームワークです。動的にレイヤーを適切なハードウェアに割り当て、データおよびリソースのプロビジョニングを管理することで、最先端の手法と比較して 14.5 倍の高いスループットと 312.3% の低い金銭的コストを達成しています。
Deep neural networks (DNNs) exploit many layers and a large number of parameters to achieve excellent performance. The training process of DNN models generally handles large-scale input data with many sparse features, which incurs high Input/Output (IO) cost, while some layers are compute-intensive. The training process generally exploits distributed computing resources to reduce training time. In addition, heterogeneous computing resources, e.g., CPUs, GPUs of multiple types, are available for the distributed training process. Thus, the scheduling of multiple layers to diverse computing resources is critical for the training process. To efficiently train a DNN model using the heterogeneous computing resources, we propose a distributed framework, i.e., Paddle-Heterogeneous Parameter Server (Paddle-HeterPS), composed of a distributed architecture and a Reinforcement Learning (RL)-based scheduling method. The advantages of Paddle-HeterPS are three-fold compared with existing frameworks. First, Paddle-HeterPS enables efficient training process of diverse workloads with heterogeneous computing resources. Second, Paddle-HeterPS exploits an RL-based method to efficiently schedule the workload of each layer to appropriate computing resources to minimize the cost while satisfying throughput constraints. Third, Paddle-HeterPS manages data storage and data communication among distributed computing resources. We carry out extensive experiments to show that Paddle-HeterPS significantly outperforms state-of-the-art approaches in terms of throughput (14.5 times higher) and monetary cost (312.3% smaller). The codes of the framework are publicly available at: https://github.com/PaddlePaddle/Paddle.
研究の動機と目的
- CPU や GPU などの多様なリソースを備えた異種コンピューティング環境において、大規模なディープニューラルネットワーク(DNN)を効率的にトレーニングする課題に対処すること。
- 分散 DNN トレーニングにおいて、厳密なスループット制約を満たしつつトレーニングコストを最小限に抑えること。
- 強化学習を用いて DNN レイヤーを異種リソースに知的にスケジューリングするスケーラブルでエラスティックなフレームワークを設計すること。
- 分散コンピューティングノード間でのデータストレージおよび通信を効率的に管理し、I/O や通信のオーバーヘッドを低減すること。
- 既存のフレームワーク(例:TensorFlow)を上回るコスト効率と高いスループットを実現する分散トレーニングを可能にすること。
提案手法
- HeterPS はパラメータサーバーアーキテクチャを採用し、異種リソース上で分散トレーニングおよびデータ管理をサポートしています。
- 各 DNN レイヤーをレイヤーの特徴とリソースの能力に基づいて、最も適したコンピューティングリソース(CPU または GPU)に割り当てる強化学習(RL)ベースのスケジューラーを使用しています。
- RL エージェントは、プロファイリングデータとスループット制約から最適なスケジューリング意思決定を学習する LSTM ベースのポリシーネットワークを用いて訓練されています。
- プロビジョニングモジュールは、スループット要件を満たしつつコストを最小限に抑えるために、コンピューティングリソースの数を動的にスケーリングします。
- I/O ボトル neck を低減するため、データストレージおよび通信の最適化を図るデータ管理技術を統合しています。
- スケジューリングとプロビジョニングを統一された RL フレームワークを用いて共同最適化することで、パフォーマンスとコストのバランスを最適化しています。

実験結果
リサーチクエスチョン
- RQ1CPU や GPU などの異種コンピューティングリソース上で DNN トレーニングを効率的にスケジューリングする方法は何か? これにより、コストを最小限に抑えつつスループット制約を満たすことができるか?
- RQ2強化学習は、ヒューリスティック法、グリーディ法、ベイズ最適化法よりも、異種環境における DNN レイヤーのスケジューリングで優れた性能を示せるか?
- RQ3動的リソースプロビジョニングは、分散 DNN トレーニングにおけるトレーニングコストとスループットにどのような影響を与えるか?
- RQ4リソースタイプの数やモデルの複雑さが増加する際、RL ベースのスケジューラーはどのようにスケーリングするか?
- RQ5TensorFlow などの最先端のフレームワークと比較して、HeterPS は金銭的コストをどれほど低減し、スループットをどれほど向上させられるか?
主な発見
- HeterPS は、混合 CPU-GPU クラスタ上で CTRDNN モデルをトレーニングする際、TensorFlow と比較して最大 14.5 倍の高いスループットを達成しています。
- HeterPS は、最先端のスケジューリング手法と比較して、最大 312.3% の低い金銭的コストを実現しており、顕著なコスト効率の向上を示しています。
- スループット制約が厳しい状況下でも、RL ベースのスケジューラーは、グリーディ法、ヒューリスティック法、ベイズ最適化法を上回り、コストとスループットの両面で優れた性能を発揮しています。
- RL-LSTM モデルのスケジューリング時間は、合計トレーニング時間のたった 0.2% から 1.8% にとどまり、実世界の展開において実用的です。
- 訓練済みの RL モデルは、MATCHNET、CTR DNN、2EMB、NCE といった異なるモデルに対しても良好に一般化しており、1 回のスケジューリング意思決定あたりの推論時間は 0.002 秒未満です。
- フレームワークのプロビジョニング手法は、特に動的ワークロード下で、ベースライン手法と比較してリソース利用効率を最大 57.9% 向上させています。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。