[論文レビュー] Efficient Algorithms for Device Placement of DNN Graph Operators
本稿では、推論および学習ワークロードにおけるDNN演算子のデバイス配置を、遅延最小化とスループット最大化を目的として、最適な整数計画法(IP)および動的計画法(DP)アルゴリズムを提示する。局所探索法に対して最大2.08倍、Scotchに対して最大7.69倍の高速化を達成し、複雑でメモリ制約のあるDNNグラフにおいて、熟練したヒューリスティクスを最大72%まで上回る遅延低減効果を示した。
Modern machine learning workloads use large models, with complex structures, that are very expensive to execute. The devices that execute complex models are becoming increasingly heterogeneous as we see a flourishing of domain-specific accelerators being offered as hardware accelerators in addition to CPUs. These trends necessitate distributing the workload across multiple devices. Recent work has shown that significant gains can be obtained with model parallelism, i.e, partitioning a neural network's computational graph onto multiple devices. In particular, this form of parallelism assumes a pipeline of devices, which is fed a stream of samples and yields high throughput for training and inference of DNNs. However, for such settings (large models and multiple heterogeneous devices), we require automated algorithms and toolchains that can partition the ML workload across devices. In this paper, we identify and isolate the structured optimization problem at the core of device placement of DNN operators, for both inference and training, especially in modern pipelined settings. We then provide algorithms that solve this problem to optimality. We demonstrate the applicability and efficiency of our approaches using several contemporary DNN computation graphs.
研究の動機と目的
- 推論および学習ワークロードにおける、異種かつメモリ制約のあるアクセラレータに大規模で複雑なDNNを展開するという、増大する課題に対処すること。
- モデル並列DNN実行における効率的なデバイス配置の背後にある核心的な組合せ最適化問題を特定し、解明すること。
- 遅延に敏感なシングルストリーム推論およびスループット最適化のパイプライン学習の両方において、証明可能な最適解を提供すること。
- メモリおよび帯域幅制約が異なるさまざまなデバイスタイプを含む、非連続なグラフ分割をサポートすること。
- 厳密なメモリ制限下でも、解の品質と頑健性の両面で、ヒューリスティクス、熟練の手法、ベースライン手法を上回ること。
提案手法
- シングルストリーム推論における遅延最小化を目的とした、演算子の分割とスケジューリングを統合的に最適化する整数計画法(IP)モデルとしてデバイス配置問題を定式化する。
- パイプライン学習におけるスループット最大化を目的とした動的計画法(DP)アプローチを開発し、データフローと計算・通信のオーバーラップをモデル化する。
- 細粒度の演算子グラフを含む任意のDAGをサポートし、複数のアクセラレータにまたがる非連続な分割を可能にする。
- メモリおよびインターコネクト制約を最適化に直接統合し、ハードウェア制限下での実行可能配置を保証する。
- 解の品質と実行時間のバランスを図るため、最適性ギャップの証明を併用した時間制限付きIPソルバを用いる。これにより実用的導入が可能になる。
- 学習(モデル並列およびパイプライン並列)および推論(シングルストリームおよびオフライン)の両方のシナリオに適用可能な統一フレームワークを採用する。
実験結果
リサーチクエスチョン
- RQ1DNN実行におけるエンドツーエンドのデバイス配置とスケジューリングのトレードオフを的確に捉える組合せ最適化問題は何か?
- RQ2推論および学習の両方において、メモリおよび通信制約下でDNNのデバイス配置を証明可能な最適に達成するにはどうすればよいか?
- RQ3連続的またはヒューリスティクスによる分割と比較して、非連続なグラフ分割は性能をどの程度向上させるか?
- RQ4提案手法は、熟練設計の手法、グリーディー法、および最先端のベースラインと比較して、遅延およびスループットの観点でどの程度優れているか?
- RQ5本最適化フレームワークは、数十億パラメータおよび複雑な演算子グラフを持つ実世界のDNNにスケーラブルに適用可能か?
主な発見
- IPベースのアルゴリズムは、グリーディー基準と比較して最大72%の遅延低減を達成し、最大負荷DPと比較しても42%低い遅延を示し、遅延最小化において優れた性能を示した。
- 最良のパフォーマンスを示したワークロードでは、IPソルバが局所探索法に対して2.08倍、Scotchに対して7.69倍の高速化を達成した。Scotchは34%のケースでメモリ制約に違反した。
- 8つのワークロードのうち5つでは、IPソルバが1時間以内に最適解に収束しなかったが、それでもすべてのベースラインを上回る解を発見した。これは、実用的性能が優れていることを示している。
- すべてのワークロードにおいて、IPソルバは7分以内に最終値の2%以内の解を発見した。これは、早期終了が高品質な結果を得るために実用的である可能性を示している。
- 人間の熟練者が設計した分割は、最大23%の遅延で劣っており、2つのケースではメモリ制約を3倍以上に超えた。これは手動チューニングの限界を示している。
- 本手法は、熟練者の分割に対して平均1.46倍、局所探索に対して1.29倍の高速化を達成し、非連続分割が常にすべての代替手法を上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。