Skip to main content
QUICK REVIEW

[論文レビュー] Survey on Large Scale Neural Network Training

Julia Gusak, Daria Cherniuk|arXiv (Cornell University)|Feb 21, 2022
Advanced Neural Network Applications被引用数 7
ひとこと要約

本調査は、単一またはマルチGPUシステム上で大規模なディープニューラルネットワークを効率的に学習するための技術について包括的な分析を提供する。メモリ削減のためのリマテリアライゼーションおよびオフロード、データ並列、モデル並列、パイプライン並列を含む並列学習戦略、勾配圧縮および低精度算術を用いた最適化手法の最適化について網羅的にカバーしており、モデルやハードウェアの変更なしに、より大きなバッチサイズと計算効率の向上を実現する。

ABSTRACT

Modern Deep Neural Networks (DNNs) require significant memory to store weight, activations, and other intermediate tensors during training. Hence, many models do not fit one GPU device or can be trained using only a small per-GPU batch size. This survey provides a systematic overview of the approaches that enable more efficient DNNs training. We analyze techniques that save memory and make good use of computation and communication resources on architectures with a single or several GPUs. We summarize the main categories of strategies and compare strategies within and across categories. Along with approaches proposed in the literature, we discuss available implementations.

研究の動機と目的

  • モデルやハードウェアを変更せずに、大規模DNNの学習効率を向上させる汎用的で侵襲的でない技術を特定すること。
  • 単一GPU上での大規模なモデルパラメータ、活性化、最適化器状態に起因するメモリボトルネックを解決すること。
  • マルチGPU学習環境における通信および計算の効率を最適化すること。
  • 大規模DNN学習におけるメモリ、計算、通信のトレードオフを評価すること。
  • 既存の技術とそれらの統合を、現代のディープラーニングフレームワークにおける体系的な比較を提供すること。

提案手法

  • バックプロパゲーション中に活性化を再計算することでGPUメモリ使用量を削減するリマテリアライゼーション。
  • CPUまたはシステムメモリへの活性化および重みのオフロードにより、GPUメモリ容量を拡張すること。
  • 勾配および最適化器状態のためのミックスド・プレシジョンおよび低ビット量子化を用いて、メモリおよび通信コストを削減すること。
  • データ並列、モデル並列、パイプラインモデル並列を活用して、複数のGPUにメモリと計算を分散させること。
  • 勾配圧縮および通信効率の良い最適化手法(例:LAMB、LARS)を適用して、GPU間のデータ交換量を削減すること。
  • チェックポイントの統合およびハイブリッド戦略(例:オフロード + リマテリアライゼーション)を用いて、メモリと計算のオーバーヘッドのバランスを取ること。

実験結果

リサーチクエスチョン

  • RQ1単一GPU上での大規模DNNに対して、最も効果的なメモリ削減技術は何か?
  • RQ2データ並列、モデル並列、パイプライン並列といった異なる並列化戦略が、通信、計算、メモリ効率にどのように影響を与えるか?
  • RQ3勾配圧縮および低精度算術は、学習のスケーラビリティをどの程度向上できるか?
  • RQ4リマテリアライゼーションおよびオフロード戦略は、並列学習と組み合わせた場合にどのように相互作用するか?
  • RQ5これらの最適化手法を用いる際の、学習速度、メモリ使用量、モデル収束性のトレードオフは何か?

主な発見

  • リマテリアライゼーションは、オフロードと組み合わせることで、計算オーバーヘッドを最小限に抑えつつ、単一GPU上で顕著なメモリ節約を実現する。
  • 活性化および重みのオフロードにより、GPUメモリ容量を超えるモデルの学習が可能になるが、通信コストが増加する。
  • 勾配圧縮および低精度算術は、マルチGPU学習における通信量を削減し、収束への影響を最小限に抑えつつスケーラビリティを向上させる。
  • パイプライン並列およびモデル並列は、GPUあたりのメモリを削減するが、通信コストを増加させる。これは勾配圧縮によって緩和できる。
  • リマテリアライゼーションとオフロードの組み合わせは、単独で用いる場合よりも高いメモリ効率を達成できる。
  • LAMB や LARS などの最適化手法は、ミックスド・プレシジョン学習と組み合わせることで、より大きなバッチサイズを実現し、安定性および収束性を向上させる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。