Skip to main content
QUICK REVIEW

[論文レビュー] Bamboo: Making Preemptible Instances Resilient for Affordable Training of Large DNNs

John Thorpe, Pengzhan Zhao|arXiv (Cornell University)|Apr 26, 2022
Cloud Computing and Resource Management被引用数 14
ひとこと要約

Bamboo は、パイプライン並列学習におけるパイプラインバブルに再計算を挿入することで、プリエンプティブルなクラウドインスタンス上で大規模な深層ニューラルネットワーク(DNN)の学習の耐障害性と効率性を向上させる分散システムです。オンデマンドインスタンスと比較して、3.7倍の高い学習スループットと2.4倍の低コストを達成しており、頻繁なプリエンプションにおいて再起動のオーバーヘッドを最小限に抑えることで、チェックポイント技術を上回ります。

ABSTRACT

DNN models across many domains continue to grow in size, resulting in high resource requirements for effective training, and unpalatable (and often unaffordable) costs for organizations and research labs across scales. This paper aims to significantly reduce training costs with effective use of preemptible instances, i.e., those that can be obtained at a much cheaper price while idle, but may be preempted whenever requested by priority users. Doing so, however, requires new forms of resiliency and efficiency to cope with the possibility of frequent preemptions - a failure model that is drastically different from the occasional failures in normal cluster settings that existing checkpointing techniques target. We present Bamboo, a distributed system that tackles these challenges by introducing redundant computations into the training pipeline, i.e., whereby one node performs computations over not only its own layers but also over some layers in its neighbor. Our key insight is that training large models often requires pipeline parallelism where "pipeline bubbles" naturally exist. Bamboo carefully fills redundant computations into these bubbles, providing resilience at a low cost. Across a variety of widely used DNN models, Bamboo outperforms traditional checkpointing by 3.7x in training throughput, and reduces costs by 2.4x compared to a setting where on-demand instances are used.

研究の動機と目的

  • 大規模な DNN の学習コストの高さに取り組むこと、特に小規模な組織や研究ラボにとっての課題を解決すること。
  • 長期にわたる DNN 学習を妨げる、プリエンプティブルなクラウドインスタンスの信頼性の低さと頻繁なプリエンプションの問題を克服すること。
  • 従来のチェックポイント技術に比べ、頻繁なプリエンプション下でも高い再起動オーバーヘッドを回避することで、学習コストの低減と効率の向上を図ること。
  • スケーラビリティやモデルサイズを犠牲にせず、プリエンプティブルリソース上で素早い回復と高いスループットを実現するシステムの設計をすること。
  • 同じ RC ベースの耐障害メカニズムを用いて、オンデマンドインスタンスの代替としてコスト効率の高い選択肢を提供すること。

提案手法

  • Bamboo は、各学習ノードが自身のモデルレイヤーだけでなく、パイプライン内の後続ノードのレイヤーの計算も実行することで、再計算(RC)を導入します。
  • パイプライン並列における「パイプラインバブル」(空き時間)を活用し、それらに再計算を埋め込むことで、プリエンプション発生時の高速な回復を可能にします。
  • ノードがアクティブな際に重複計算を避けるために、軽量な調整メカニズムを用いて整合性を保証します。
  • 同じ RC ベースの耐障害メカニズムを用いて、パイプライン並列と純粋なデータ並列の両方をサポートします。
  • 完全なチェックポイントを回避するため、パイプラインバブルに事前に計算結果をプリコンピュートおよびキャッシュすることで、再起動時間を短縮し、無駄な計算を削減します。
  • 予測不能なプリエンプションに対する耐障害性を最大化しつつ、リソースオーバーヘッドを最小限に抑えるように設計されています。

実験結果

リサーチクエスチョン

  • RQ1パイプラインバブルにおける再計算が、プリエンプティブルインスタンス上での学習再起動オーバーヘッドを顕著に低減できるか?
  • RQ2頻繁なプリエンプション下で、Bamboo のアプローチは従来のチェックポイント技術と比べて、学習スループットとコスト効率の面で優れているか?
  • RQ3オンデマンドインスタンスと比較して、Bamboo はどれほど学習コストを削減できるか、かつ高いスループットを維持できるか?
  • RQ4同じ RC メカニズムをパイプライン並列と純粋なデータ並列の両方に対して効果的に適用できるか?
  • RQ5Bamboo のパフォーマンスとコストインパクトは、幅広く使われる多様な DNN アーキテクチャにおいてどのように現れるか?

主な発見

  • Bamboo は、プリエンプティブルインスタンス上でのチェックポイントベースのアプローチと比較して、3.7 倍の高い学習スループットを達成しています。
  • オンデマンドインスタンスを使用する場合と比較して、学習コストを 2.4 倍削減しており、強いコスト効率を示しています。
  • 頻繁なプリエンプションが発生する状況では、チェックポイント技術が GPT-2(64 個のスポットインスタンス使用時)で最大 77% の学習時間を無駄にしているのに対し、Bamboo は著しく優れています。
  • Bamboo の再計算技術は、顕著なオーバーヘッドやリソース競合を引き起こさずに、空き時間のパイプラインバブルを効果的に埋めています。
  • 6 つの代表的な DNN モデルに対して、スループットの向上とコスト削減の両面で一貫した効果が確認されています。
  • Bamboo の設計は、パイプライン並列と純粋なデータ並列の両方へ一般化可能であり、大規模な DNN 学習における広範な適用性を有しています。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。