Skip to main content
QUICK REVIEW

[論文レビュー] ImageNet/ResNet-50 Training in 224 Seconds.

Hiroaki Mikami, Hisahiro Suganuma|arXiv (Cornell University)|Nov 13, 2018
Advanced Neural Network Applications参考文献 5被引用数 57
ひとこと要約

本論文では、大規模なGPUクラスタを用いて、バッチサイズ制御とラベルスムージングを組み合わせて大規模ミニバッチ学習の安定化を図り、2D-Torus all-reduceを用いて勾配同期のオーバーヘッドを最小限に抑えることで、ImageNet/ResNet-50の学習をわずか122秒で実現する手法を提示する。このアプローチは、最小限の精度低下で準最先端の精度を達成し、大規模な分散学習における極めて効率的な性能を示している。

ABSTRACT

Scaling the distributed deep learning to a massive GPU cluster level is challenging due to the instability of the large mini-batch training and the overhead of the gradient synchronization. We address the instability of the large mini-batch training with batch-size control and label smoothing. We address the overhead of the gradient synchronization with 2D-Torus all-reduce. Specifically, 2D-Torus all-reduce arranges GPUs in a logical 2D grid and performs a series of collective operation in different orientations. These two techniques are implemented with Neural Network Libraries (NNL). We have successfully trained ImageNet/ResNet-50 in 122 seconds without significant accuracy loss on ABCI cluster.

研究の動機と目的

  • ResNet-50のようなディープラーニングモデルにおける大規模ミニバッチ学習に内在する不安定性を解消すること。
  • 大規模なGPUクラスタに跨る分散学習における勾配同期の通信オーバーヘッドを低減すること。
  • モデル精度を保持したまま、ImageNet/ResNet-50のエンドツーエンド学習を2分未塔で実現すること。
  • 最適化された集約通信および学習技術を用いて、スケーラブルで安定した学習を実装すること。

提案手法

  • 大規模ミニバッチを用いた学習の安定化のため、バッチサイズ制御が適用され、最適化の不安定性が軽減される。
  • 一般化性能の向上と過学習の低減を図るため、ラベルスムージングが大規模ミニバッチ環境で使用される。
  • GPUを論理的な2次元グリッドに配置することで、クラスタ全体にわたる効率的で低遅延の勾配同期が実現される。
  • 2D-Torus all-reduceは、複数の方向での集約操作を実行することで、通信ボトルネックを低減する。
  • 神経ネットワークライブラリ(NNL)を用いて、提案手法の実装および学習パイプラインへの統合が行われる。
  • 性能と精度の妥当性を検証するため、システムはABC I GPUクラスタにデプロイされ評価される。

実験結果

リサーチクエスチョン

  • RQ1大規模ミニバッチ学習を、モデル精度を損なわせることなく効果的に安定化できるか?
  • RQ2大規模分散学習において、勾配同期の通信オーバーヘッドをどのように最小限に抑えることができるか?
  • RQ3最適化された通信および学習技術を用いた場合、ImageNet/ResNet-50の学習にどの程度の時間が必要か?
  • RQ4競争力のある精度を維持したまま、学習速度をどの程度向上できるか?

主な発見

  • ABC I GPUクラスタ上での提案手法を用いた結果、ImageNet/ResNet-50の学習が122秒で成功裏に完了した。
  • 標準的な学習と比較して最小限の精度低下で、準最先端の精度が達成された。
  • バッチサイズ制御とラベルスムージングの組み合わせが、大規模ミニバッチ学習の安定化に効果的に寄与した。
  • 2D-Torus all-reduceの通信パターンにより、同期のオーバーヘッドが顕著に低減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。