[論文レビュー] Random-LTD: Random and Layerwise Token Dropping Brings Efficient Training for Large-scale Transformers
Random-LTDは、中間Transformer層全体にわたりランダムに選択されたトークンを飛ばすことで計算を省略するランダムかつレイヤーワイズのトークンドロップ手法を提案する。重要度スコアや特別なトークン処理の必要性を排除し、GPT-3 1.3Bでゼロショット性能と同等の結果を得ながら、理論的計算量を最大33.3%削減し、壁時計時間のトレーニング時間を25.6%削減する。また、収束を向上させ、チューニングの負荷を軽減するための新しいLayerToken学習率スケジュールを導入している。
Large-scale transformer models have become the de-facto architectures for various machine learning applications, e.g., CV and NLP. However, those large models also introduce prohibitive training costs. To mitigate this issue, we propose a novel random and layerwise token dropping method (random-LTD), which skips the computation of a subset of the input tokens at all middle layers. Particularly, random-LTD achieves considerable speedups and comparable accuracy as the standard training baseline. Compared to other token dropping methods, random-LTD does not require (1) any importance score-based metrics, (2) any special token treatment (e.g., [CLS]), and (3) many layers in full sequence length training except the first and the last layers. Besides, a new LayerToken learning rate schedule is proposed for pretraining problems that resolve the heavy tuning requirement for our proposed training mechanism. Finally, we demonstrate that random-LTD can be applied to broader applications, including GPT and BERT pretraining as well as ViT and GPT finetuning tasks. Our results show that random-LTD can save about 33.3% theoretical compute cost and 25.6% wall-clock training time while achieving similar zero-shot evaluations on GPT-31.3B as compared to baseline.
研究の動機と目的
- 自然言語処理およびビジョン応用分野における大規模なTransformerのトレーニングコストの削減を目的とする。
- トークンドロップ手法において、重要度スコアや特別なトークン処理(例:[CLS])への依存を排除することを目的とする。
- 効率性を最大化するために、一部の層に限定せず、すべての中間層にわたってトークンドロップを可能にすることを目的とする。
- 新しいLayerTokenベースの学習率スケジュールにより、ハイパーパrameterチューニングの負荷を軽減することを目的とする。
- BERT、GPT、ViTのpretrainingおよびfine-tuningを含む多様なタスクにおいて、手法の有効性を検証することを目的とする。
提案手法
- Random-LTDは、重要度スコアや特別なトークンの保存を用いずに、中間Transformer層の各層でランダムにトークンをドロップする。
- 各層が独立してトークンをドロップすることで、層間のアテンション依存関係を維持し、全シーケンス長のボトルネックを回避する。
- 自己回帰モデルにおける勾配ノイズを低減し、トレーニングと推論のギャップを縮小するために、単調なシーケンス長の増加スケジュールを導入する。
- 累積的な各層ごとのトークン消費量に基づいて学習率をスケーリングする新しいLayerToken学習率スケジュールを提案し、収束性を向上させる。
- BERT、GPT、ViTアーキテクチャの全構造に同一の方法を適用し、pretrainingおよびfine-tuningに適用する。
- このアプローチは正則化効果を示しており、ドロップアウトの代わりに使用するか、組み合わせることで性能向上を実現することが示された。
実験結果
リサーチクエスチョン
- RQ1重要度スコアや特別なトークン処理に依存せずに、ランダムかつレイヤーワイズのトークンドロップが顕著なトレーニング効率向上を達成できるか?
- RQ2多様なアーキテクチャにおいて、Random-LTDは計算コスト、壁時計時間、モデル精度の観点でベースライントレーニングと比較してどうなるか?
- RQ3LayerTokenベースの学習率スケジュールは、Random-LTDトレーニングにおけるチューニングの負荷を軽減し、収束性を向上させるのに効果的か?
- RQ4Random-LTDは、pretrainingおよびfine-tuningにおけるモデルの汎化性能を向上させる正則化効果を示すか?
- RQ5Random-LTDは、因果的言語モデルやビジョンTransformerを含む、さまざまなTransformerアーキテクチャおよびタスクに一般化可能か?
主な発見
- Random-LTDは、GPT-3 1.3Bにおいて理論的計算コストを最大33.3%削減し、壁時計時間のトレーニング時間を最大25.6%削減しながら、ゼロショット評価性能はベースラインと同等を維持した。
- LayerToken学習率スケジュールを用いることで、ベースラインと同等の検証損失を達成し、Random-LTDトレーニングにおいて標準的な学習率スケジュールを上回る性能を示した。
- BERT large pretrainingにおいて、ドロップアウトなしのRandom-LTDは、RACE-mで標準ベースラインよりも1%以上の高い精度を達成し、正則化効果を示した。
- GPT-3 1.3Bにおいて、2880BのLayerTokensを用いたRandom-LTDは、4320BのLayerTokensを用いたベースラインと同等の性能を示し、予算の有効利用を実証した。
- LayerToken学習率スケジュールは、各層のトークン消費量に応じて学習率を適応的に調整することで、特に後期のトレーニング段階で収束性を顕著に向上させた。
- Random-LTDは、BERTおよびGPTのpretraining、およびViTのfine-tuningを含む多様なタスクで一貫した性能向上を示し、広範な適用可能性を確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。