Skip to main content
QUICK REVIEW

[論文レビュー] Budgeted Training: Rethinking Deep Neural Network Training Under Resource Constraints

Mengtian Li, Ersin Yumer|arXiv (Cornell University)|May 12, 2019
Advanced Neural Network Applications参考文献 72被引用数 18
ひとこと要約

この論文は、固定リソース制約、特に限定的なトレーニングイテレーション数の下で深層ニューラルネットワークを最適化するための形式的フレームワークとして、予算付きトレーニングを導入する。学習率スケジュールは、与えられた予算に合わせて明示的に調整されるべきであり、トレーニング終了時に線形にゼロに減少するスケジュールが、複数のベンチマークで優れた性能を示し、標準的および適応的スケジュールを上回る。これは、リソース制限内でのより良い収束を実現する。

ABSTRACT

In most practical settings and theoretical analyses, one assumes that a model can be trained until convergence. However, the growing complexity of machine learning datasets and models may violate such assumptions. Indeed, current approaches for hyper-parameter tuning and neural architecture search tend to be limited by practical resource constraints. Therefore, we introduce a formal setting for studying training under the non-asymptotic, resource-constrained regime, i.e., budgeted training. We analyze the following problem: "given a dataset, algorithm, and fixed resource budget, what is the best achievable performance?" We focus on the number of optimization iterations as the representative resource. Under such a setting, we show that it is critical to adjust the learning rate schedule according to the given budget. Among budget-aware learning schedules, we find simple linear decay to be both robust and high-performing. We support our claim through extensive experiments with state-of-the-art models on ImageNet (image classification), Kinetics (video classification), MS COCO (object detection and instance segmentation), and Cityscapes (semantic segmentation). We also analyze our results and find that the key to a good schedule is budgeted convergence, a phenomenon whereby the gradient vanishes at the end of each allowed budget. We also revisit existing approaches for fast convergence and show that budget-aware learning schedules readily outperform such approaches under (the practical but under-explored) budgeted training setting.

研究の動機と目的

  • 最適化イテレーション数が固定された非漸近的かつリソース制約のある条件下でのトレーニングを形式化すること。
  • 無限の計算を前提とする従来の手法のギャップを埋めるために、与えられた予算内でのパフォーマンス最大化を最適化目標として再定義すること。
  • トレーニングが限定的なイテレーション数に制限される状況において、学習率スケジュールが収束およびモデルパフォーマンスに与える影響を調査すること。
  • 実用的かつリソース制限のある環境下で、予算に配慮した学習率スケジュールが標準的および適応的スケジュールを著しく上回ることを示すこと。

提案手法

  • 予算付きトレーニングを最適化問題として形式化:固定されたトレーニングイテレーション数の下でモデルパフォーマンスを最大化すること。
  • 学習率スケジュールは、予算の終了時に勾配の大きさが小さくなるように設計されるべきであり、これを「予算付き収束」と呼ぶ。
  • 予算の終了時に線形にゼロに減少する学習率減衰を採用し、最適なパフォーマンスを達成するシンプルで効果的な戦略とする。
  • 分類、検出、セグメンテーションタスクの全範囲にわたる最先端モデルを用いて、ImageNet、Kinetics、MS COCO、Cityscapesで広範な実験を実施。
  • 学習率と全勾配ノルムの相関関係を分析し、最終的なトレーニング段階で低い学習率が小さい勾配をもたらすことを示した。
  • 予算付き設定における不要な評価オーバーヘッドを最小限に抑えるために、最終チェックポイントでの検証精度をモデルパフォーマンスの評価指標として使用。

実験結果

リサーチクエスチョン

  • RQ1収束まで実行するのではなく、固定されたイテレーション数に制限されたトレーニングでは、パフォーマンスはどのように変化するか?
  • RQ2リソース制約下での最適パフォーマンスを達成するために、学習率スケジュールは果たす役割は何か?
  • RQ3線形減衰のような単純で滑らかな学習率スケジュールが、より複雑なまたは適応的スケジュールを上回る可能性はあるか?
  • RQ4AMSGrad や SGDR のような適応的最適化手法は、初期段階で高速に減少するが、なぜ予算付きトレーニングでは強いパフォーマンスを発揮しないのか?
  • RQ5学習率の減少とトレーニング終了時の勾配ノルムの減少の間に、統計的またはメカニズム的リンクがあるか?

主な発見

  • 線形学習率減衰を予算の終了時にゼロにすることで、評価されたすべてのデータセットおよびタスクで、標準的および適応的スケジュールを一貫して上回る性能を達成した。
  • 最もパフォーマンスの良いモデルは、通常、線形または多項式減衰を使用した場合、最終イテレーションに正確に位置しており、これにより最終的なみだりにのみ検証すれば十分になる。
  • ImageNet における ResNet-18 では、線形減衰により、バッチサイズを全量にしたトレーニングの 98.6% のパフォーマンスを、予算の 10% のみで達成した。一方、定数学習率では 81.2% にとどまった。
  • AMSGrad および SGDR は初期段階で急激に減少するが、予算の終了時に全勾配ノルムがゼロに近づかないため、予算付き収束に失敗している。
  • 減少する学習率と減少する全勾配ノルムの間には強い相関関係が観察され、学習率スケジュールが最適化段階を制御している可能性を示唆している。
  • 予算に配慮したスケジュールは、中間のモデルチェックポイント作成や検証の必要性を低減し、Kinetics における動画分類のような高コストなタスクで顕著なコンピューティングリソースの節約が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。