Skip to main content
QUICK REVIEW

[論文レビュー] No Parameters Left Behind: Sensitivity Guided Adaptive Learning Rate for Training Large Transformer Models

Liang Chen, Haoming Jiang|arXiv (Cornell University)|Feb 6, 2022
Topic Modeling被引用数 8
ひとこと要約

この論文では、モデル性能に対する各パラメータの感受性に基づいて個々の学習率を動的に調整する感受性誘導型の適応的学習率スケジュールSAGEを提案する。低感受性(未訓練)パラメータの学習率を増加させ、高感受性(十分訓練済み)パラメータの学習率を減少させることで、冗長性を低減し一般化性能を向上させる。SAGEは、自然言語処理およびビジョンタスクにおいて、標準的な最適化手法を上回る一貫した性能向上を達成し、最先端の性能を実現した。

ABSTRACT

Recent research has shown the existence of significant redundancy in large Transformer models. One can prune the redundant parameters without significantly sacrificing the generalization performance. However, we question whether the redundant parameters could have contributed more if they were properly trained. To answer this question, we propose a novel training strategy that encourages all parameters to be trained sufficiently. Specifically, we adaptively adjust the learning rate for each parameter according to its sensitivity, a robust gradient-based measure reflecting this parameter's contribution to the model performance. A parameter with low sensitivity is redundant, and we improve its fitting by increasing its learning rate. In contrast, a parameter with high sensitivity is well-trained, and we regularize it by decreasing its learning rate to prevent further overfitting. We conduct extensive experiments on natural language understanding, neural machine translation, and image classification to demonstrate the effectiveness of the proposed schedule. Analysis shows that the proposed schedule indeed reduces the redundancy and improves generalization performance.

研究の動機と目的

  • 大規模なトランスフォーマー・モデルにおける冗長パラメータが真に無意味なものなのか、あるいは最適でない最適化戦略による不十分な訓練の結果なのかを調査すること。
  • 不十分な訓練がパラメータの未訓練状態の原因であるという仮説を検証すること。
  • 感受性に基づいて学習率を適応的に調整することで、すべてのパラメータが十分に訓練されるようにするトレーニング戦略を開発すること。
  • 動的学習率スケジューリングによる重みの冗長性低減を通じて、モデルの一般化性能を向上させること。
  • 提案手法が既存の適応的最適化手法と互換性があり、それらを強化できることを示すこと。

提案手法

  • 本手法は、各パラメータのモデル性能への寄与度を測る勾配ベースの指標である感受性に基づいた、パラメータごとの学習率スケジュールを導入する。
  • 感受性が低いパラメータ(冗長性や未訓練状態を示す)には、訓練を加速させるために高い学習率を割り当てる。
  • 感受性が高いパラメータ(強い寄与度または過学習リスクを示す)には、正則化を図るために低い学習率を割り当てる。
  • 感受性推定の不安定性や不確実性を考慮するため、現在の感受性とその指数移動平均との絶対差を、局所的時間的変動として計算する。
  • 各パラメータの最終的な学習率は、感受性と局所的時間的変動の両方の関数として定義され、ノイズが多いまたは変動する感受性値に対してもロバスト性を確保する。
  • 本手法は、Adamなどの既存の適応的最適化手法と互換性があり、標準的なトレーニングパイプラインにスムーズに統合可能である。

実験結果

リサーチクエスチョン

  • RQ1適応的学習率スケジューリングにより、より効果的に訓練された場合、大規模なトランスフォーマー・モデルにおける冗長パラメータが有用になることができるか?
  • RQ2感受性に基づく学習率適応戦略は、モデルの冗長性を低減させ、一般化性能を向上させるか?
  • RQ3提案手法は、多様な自然言語処理およびビジョンタスクにおいて、標準的な最適化手法と比較してどうなるか?
  • RQ4感受性誘導型の学習率スケジュールは、最先端の正則化技術と効果的に組み合わせられるか?
  • RQ5本手法は、より広いハイパーパramータ探索領域内でも過学習を低減し、一般化性能を向上させるか?

主な発見

  • SAGEは、BERT-baseの微調整において、最大20%のパラメータをプルーニングしても、RTEデータセットで一般化性能が1%向上した。
  • GLUEベンチマークでは、SAGEがAdamaxを用いた場合、平均で2.6ポイント高い性能を達成し、全タスクで向上を示した。特にRTEでは3.4ポイントの向上を記録した。
  • スパイラルデータセットにおいて、SAGEが学習した決定境界は、Adamよりも滑らかでマージンが広く、一般化性能の向上を示している。
  • SAGEはトレーニング中における感受性スコアの分散を低減させ、よりバランスの取れた十分なパラメータ訓練を示している。
  • SAGEは、ハイパーパramータ探索領域の広い範囲で一貫して一般化性能を向上させ、特に学習率と$eta$ハイパーパramータにおいて顕著な改善を示した。
  • SMART(最先端の敵対的正則化手法)と組み合わせた場合、SAGEはさらなる性能向上を達成し、既存の正則化技術と相乗効果を発揮することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。