[論文レビュー] Training Kinetics in 15 Minutes: Large-scale Distributed Training on Videos
本稿では、時空間シフトモジュール(TSM)を用いたハードウェアに配慮した動画モデル設計を提案する。これにより、動画のスケーラブルで高スループットな分散学習が可能になる。FLOPsの最小化、入力フレーム数の削減、モデルサイズの縮小により、1,536 GPU 上で I3D モデルと比較して 1.6× および 2.9× の高速化が達成され、Kinetics の学習を 14 分 13 秒で完了し、トップ-1 精度は 74.0% を達成した。
Deep video recognition is more computationally expensive than image recognition, especially on large-scale datasets like Kinetics [1]. Therefore, training scalability is essential to handle a large amount of videos. In this paper, we study the factors that impact the training scalability of video networks. We recognize three bottlenecks, including data loading (data movement from disk to GPU), communication (data movement over networking), and computation FLOPs. We propose three design guidelines to improve the scalability: (1) fewer FLOPs and hardware-friendly operator to increase the computation efficiency; (2) fewer input frames to reduce the data movement and increase the data loading efficiency; (3) smaller model size to reduce the networking traffic and increase the networking efficiency. With these guidelines, we designed a new operator Temporal Shift Module (TSM) that is efficient and scalable for distributed training. TSM model can achieve 1.8x higher throughput compared to previous I3D models. We scale up the training of the TSM model to 1,536 GPUs, with a mini-batch of 12,288 video clips/98,304 images, without losing the accuracy. With such hardware-aware model design, we are able to scale up the training on Summit supercomputer and reduce the training time on Kinetics dataset from 49 hours 55 minutes to 14 minutes 13 seconds, achieving a top-1 accuracy of 74.0%, which is 1.6x and 2.9x faster than previous 3D video models with higher accuracy. The code and more details can be found here: http://tsm-hanlab.mit.edu.
研究の動機と目的
- 高い計算負荷、I/O、通信要件による動画認識学習の拡張の課題に対処する。
- 分散動画学習における3つの主要なボトル neck を同定する:計算の FLOPs、データロードの I/O、通信帯域幅。
- 計算、データロード、ネットワーク効率の各分野におけるスケーラビリティを向上させるためのハードウェアに配慮したモデル設計ガイドラインを開発する。
- スーパーコンピュータ上で Kinetics などの大規模動画モデルを、数日ではなく数分でエンドツーエンドで学習可能にする。
- モデルアーキテクチャの選択が、精度を損なわずに学習時間を著しく短縮できることを示す。
提案手法
- FLOPs を削減するためのハードウェアフレンドリーな演算子、入力フレーム数を最小限に抑えることで I/O を削減、モデルサイズを縮小して通信オーバーヘッドを低減するという3つの設計ガイドラインを提案する。
- 時空間的モデリングを可能にするゼロ FLOPs、ゼロパラメータの演算子として、2次元畳み込みニューラルネットワークに時間方向にチャネルをシフトする「時空間シフトモジュール(TSM)」を導入する。
- 畳み込みプールアップ方式に比べて多くのフレームを必要としないため、I/O 負荷を低減するため、8フレーム入力のシンプルなバックボーン設計を採用する。
- Summit スーパーコンピュータ上で最大 1,536 GPU を使用し、ミニバッチサイズが 12,288 個の動画クリップ(98,304 枚の画像)となるように、同期的確率的勾配降下法(SGD)を分散して実装する。
- ハードウェアの制限により、3,072 および 6,144 GPU での学習をシミュレートするために勾配蓄積を適用し、精度評価を維持する。
- 3次元畳み込みよりも効率の高い2次元畳み込みを活用することで、ハードウェア利用効率を向上させるため、学習効率を最適化する。
実験結果
リサーチクエスチョン
- RQ1計算、データロード、通信のボトル neck が、大規模動画学習のスケーラビリティにどのように影響するか?
- RQ2モデルアーキテクチャの設計が、動画データセットにおける学習スループットとスケーラビリティを著しく向上させられるか?
- RQ3FLOPs、入力フレーム数、モデルサイズの低減が、分散動画学習における効率向上にどの程度寄与するか?
- RQ41,536 GPU を使用して Kinetics データセットで 15 分未満の学習時間を達成しながら、高い精度を維持できるか?
- RQ5TSM モジュールは、2次元畳み込みニューラルネットワークフレームワークにおいて、ゼロ FLOPs およびゼロパラメータで効果的な時系列モデリングをどのように実現するか?
主な発見
- 1,536 GPU 上での TSM ベースの学習により、Kinetics の学習が 14 分 13 秒で完了し、学習時間は 49 時間 55 分 から 15 分未満に短縮された。
- TSM モデルは、Kinetics でトップ-1 精度 74.0% を達成しており、顕著に高速化されているにもかかわらず、以前の I3D モデルと同等またはそれを上回る精度を維持している。
- TSM 学習は 1,536 GPU で 80% のスケーリング効率に達しており、ハードウェアリソース全体にわたる良好な線形的スケーラビリティを示している。
- 12,288 個の動画クリップ(98,304 枚の画像)のバッチサイズまで精度が維持され、性能に劣化がないことが確認された。
- 同じハードウェア上で、I3D 3×3×3 および I3D 3×1×1 モデルと比較して、TSM はそれぞれ 1.6× および 2.9× の高い学習スループットを達成した。
- 勾配蓄積のシミュレーションから、3,072 および 6,144 GPU では精度の低下が生じたため、安定した大規模学習の実行に実用的な上限があることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。