Skip to main content
QUICK REVIEW

[論文レビュー] Automated Progressive Learning for Efficient Training of Vision Transformers

Changlin Li, Bohan Zhuang|arXiv (Cornell University)|Mar 28, 2022
Advanced Neural Network Applications被引用数 4
ひとこと要約

本稿では、ビジョントランスフォーマー(ViT)の学習を動的にかつ効率的にモデル容量を拡大することで、学習速度を向上させる自動的で段階的な学習フレームワークであるAutoProgを提案する。成長スケジュール最適化をサブネットワークアーキテクチャ探索問題として定式化し、パラメータ再利用を活用したワンショット性能推定を用いることで、DeiTおよびVOLOモデルにおいて精度に損なわれることなくImageNetで最大85.1%の学習速度向上を達成する。

ABSTRACT

Recent advances in vision Transformers (ViTs) have come with a voracious appetite for computing power, high-lighting the urgent need to develop efficient training methods for ViTs. Progressive learning, a training scheme where the model capacity grows progressively during training, has started showing its ability in efficient training. In this paper, we take a practical step towards efficient training of ViTs by customizing and automating progressive learning. First, we develop a strong manual baseline for progressive learning of ViTs, by introducing momentum growth (MoGrow) to bridge the gap brought by model growth. Then, we propose automated progressive learning (AutoProg), an efficient training scheme that aims to achieve lossless acceleration by automatically increasing the training overload on-the-fly; this is achieved by adaptively deciding whether, where and how much should the model grow during progressive learning. Specifically, we first relax the optimization of the growth schedule to sub-network architecture optimization problem, then propose one-shot estimation of the sub-network performance via an elastic supernet. The searching overhead is reduced to minimal by recycling the parameters of the supernet. Extensive experiments of efficient training on ImageNet with two representative ViT models, DeiT and VOLO, demonstrate that AutoProg can accelerate ViTs training by up to 85.1% with no performance drop. Code: https://github.com/changlin31/AutoProg

研究の動機と目的

  • 大規模ビジョントランスフォーマー(ViTs)の学習にかかる高い計算コストと環境的負荷を軽減すること。これは、モデルサイズやデータ量の増加に伴い、スケーリングが著しく悪化するためである。
  • 特に初期学習段階において、すべてのパラメータの役割を再考することで、学習効率を向上させること。
  • 手動によるハイパーパrameterチューニングを回避する、一般化可能な自動的で段階的なViT学習スキームの開発。
  • リアルタイムの性能フィードバックに基づいて動的にモデル成長を適応させる手法により、損なわれない学習速度向上を達成すること。
  • パラメータ再利用とワンショットスーパーネット推定を活用することで、段階的学習における探索コストを低減すること。

提案手法

  • モデル容量拡大時の性能ギャップを埋めるために、効果的なモーメンタム更新スキームを用いる成長オペレータ「Momentum Growth(MoGrow)」を提案する。
  • 成長スケジュール最適化をサブネットワークアーキテクチャ探索問題として再定式化することで、自動的で適応的な成長意思決定を可能にする。
  • ワンショットでサブネットワークの性能を推定できるエラスティックスーパーネットを導入し、探索コストを著しく削減する。
  • 学習段階を跨いでスーパーネットのパラメータを再利用することで、計算オーバーヘッドを最小限に抑え、効率性を維持する。
  • モデルサイズに応じて増幅強度とドロップアウト確率をスケーリングする適応的正則化(AdaReg)を採用し、安定性と性能を向上させる。
  • 二段階の学習プロセスを採用する:まずサブネットワークを訓練し、次に最適化された成長パラメータを用いて全容量に拡大する。

実験結果

リサーチクエスチョン

  • RQ1多様なViTアーキテクチャにわたって一貫した学習速度向上を達成できるように、段階的学習を自動化することは可能か? ただし、性能の低下を伴わないものとする。
  • RQ2再訓練やハイパーパrameterチューニングにかかる高コストを回避しながら、成長スケジュールを効率的に最適化できるか?
  • RQ3ワンショットスーパーネット推定とパラメータ再利用は、段階的学習における探索コストをどの程度低減できるか?
  • RQ4モーメンタムベースの重み初期化(MoGrow)は、補間やランダム初期化といった標準的手法を上回る性能を示すか?
  • RQ5適応的正則化は、ViTの段階的学習における収束性と精度にどのような影響を与えるか?

主な発見

  • AutoProgは、VOLO-D1でImageNetのトップ-1精度に損なわれることなく最大85.1%の学習速度向上を達成し、損なわれない加速を実証した。
  • 提案されたMoGrow成長オペレータは、ベースライン手法よりも最終精度を0.2%向上させ、スーパーネット性能を2.73%向上させた。
  • 重み再利用により、VOLO-D1で速度向上が12.3%向上し、65.6%の速度向上を達成したが、精度に損なわれることなく実現された。
  • 適応的正則化はVOLO-D1において不可欠であり、欠如すると1.2%の精度低下を引き起こしたが、DeiT-Sでは効果がなく、使用すると収束しなかった。
  • DeiT-Sでは、AdaRegを用いない場合に40.7%の速度向上を達成したが、VOLO-D1ではAdaRegを用いることで85.1%の速度向上を達成し、モデル間での強力な一般化性を示した。
  • アブレーションスタディの結果、MoGrow、重み再利用、AdaRegはすべて、AutoProgにおける最適性能を発揮するために不可欠な要素であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。