Skip to main content
QUICK REVIEW

[論文レビュー] Robustness to Unbounded Smoothness of Generalized SignSGD

Michael Crawshaw, Mingrui Liu|arXiv (Cornell University)|Aug 23, 2022
Sparse and Compressive Sensing Techniques被引用数 4
ひとこと要約

本稿では、勾配クリッピングを必要とせずに、勾配とヘッセ行列のノルムが無限大に発散する可能性がある緩い $(L_0, L_1)$ スムーズネス条件下でも、勾配クリッピング付きSGDと同等の収束速度を達成する一般化された SignSGD アルゴリズムを提案する。この手法はモーメンタムを用いてスムーズネスと勾配ノルムを暗黙的に制御し、変換器などのディープラーニングモデルにおいても安定した性能を発揮し、Adamと同等の精度を達成するとともに、他の最適化手法を上回る。

ABSTRACT

Traditional analyses in non-convex optimization typically rely on the smoothness assumption, namely requiring the gradients to be Lipschitz. However, recent evidence shows that this smoothness condition does not capture the properties of some deep learning objective functions, including the ones involving Recurrent Neural Networks and LSTMs. Instead, they satisfy a much more relaxed condition, with potentially unbounded smoothness. Under this relaxed assumption, it has been theoretically and empirically shown that the gradient-clipped SGD has an advantage over the vanilla one. In this paper, we show that clipping is not indispensable for Adam-type algorithms in tackling such scenarios: we theoretically prove that a generalized SignSGD algorithm can obtain similar convergence rates as SGD with clipping but does not need explicit clipping at all. This family of algorithms on one end recovers SignSGD and on the other end closely resembles the popular Adam algorithm. Our analysis underlines the critical role that momentum plays in analyzing SignSGD-type and Adam-type algorithms: it not only reduces the effects of noise, thus removing the need for large mini-batch in previous analyses of SignSGD-type algorithms, but it also substantially reduces the effects of unbounded smoothness and gradient norms. We also compare these algorithms with popular optimizers on a set of deep learning tasks, observing that we can match the performance of Adam while beating the others.

研究の動機と目的

  • 変換器やLSTMのような、無限大に発散するスムーズネスを示すディープラーニングモデルに特化した、従来のスムーズネス仮定の制限を解消すること。
  • 特にAdamタイプのアルゴリズムに対して、緩い $(L_0, L_1)$ スムーズネス条件下でも勾配クリッピングが不要であることを示すこと。
  • SignSGDとAdamの間を滑らかに補間する一般化された SignSGD アルゴリズムを提案し、理論的に解析することで、明示的なクリッピングの必要性を排除すること。
  • 実験的に、モーメンタムのみで無限大に発散するスムーズネス下でも学習を安定化できることを示し、Adamにおけるクリッピングの無効性を説明すること。

提案手法

  • SignSGDを極端に回復させるとともに、Adamに近くするパラメータ化された一般化された SignSGD アルゴリズムを導入し、適応的モーメンタムと正規化された勾配の符号を用いる。
  • ディープネットワークにおける層やパラメータごとの勾配挙動の不均一性をよりよく捉えるために、座標ごとの $(L_0, L_1)$ スムーズネス仮定を採用する。
  • モーメンタムが勾配ノルムとスムーズネス項に指数的減衰を引き起こすことで、無限大に発散するスムーズネス下でも収束を理論的に証明する。
  • ノイズの影響を軽減し、無限大に発散する勾配ノルムの影響を抑制するために、モーメンタムを用い、明示的なクリッピングの代わりに機能させる。
  • ハイパーパramータ(学習率、重み減衰、$eta_2$)のチューニングと、複数回の訓練ランを用いたグリッドサーチを実施し、変換器モデルにおける最適化手法間の性能を比較する。
  • WMT’16 ドイツ語-英語翻訳および Wikitext-2 タスクで手法を検証し、5つのランダムシードで訓練損失、パープレキシティ、精度を測定する。

実験結果

リサーチクエスチョン

  • RQ1緩い $(L_0, L_1)$ スムーズネス条件下で、明示的な勾配クリッピングなしに、SignSGD型アルゴリズムがクリッピング付きSGDと同等の収束速度を達成できるか?
  • RQ2非凸最適化における無限大に発散するスムーズネスと勾配ノルムの影響を軽減するために、モーメンタムが果たす役割は何か?
  • RQ3Adamの無限大に発散するスムーズネスに対する頑健性は、暗黙のクリッピングに起因するのか? そして、この性質をSignSGDフレームワークで再現可能か?
  • RQ4SignSGDとAdamを統合する統一アルゴリズムを設計可能か? これにより理論的頑健性と実験的性能を両立できるか?
  • RQ5無限大に発散するスムーズネス下で、一般化された SignSGD アルゴリズムは大規模な変換器モデルにおいてAdamを上回る性能を達成できるか?

主な発見

  • 提案された一般化された SignSGD アルゴリズムは、WMT’16 ドイツ語-英語翻訳タスクでテストパープレキシティ 7.2731 ± 0.0870 を達成し、SGDにモーメンタムとクリッピングを適用したすべてのベースラインを上回った。
  • アルゴリズムはAdamと同等のテスト精度 68.9828 ± 0.2786 を達成した一方で、Adamの 1.4303 ± 0.0009 よりも顕著に低い訓練損失 1.6263 ± 0.0024 を達成した。
  • 実験的結果から、大規模な変換器モデルを学習する際、Adamの性能に勾配クリッピングの効果はほとんど認められず、第二モーメント正規化による暗黙のクリッピングが存在する可能性が示された。
  • 座標ごとの $(L_0, L_1)$ スムーズネス仮定は、変換器上で実験的に妥当であることが確認され、層やパラメータごとに異なる $L_0$ および $L_1$ 値が観察された。
  • モーメンタムが、無限大に発散するスムーズネスと勾配ノルムを抑制する上で中心的な役割を果たしており、明示的なクリッピングなしに安定した収束を可能にした。
  • モーメンタムとクリッピングを併用したSGDは、提案手法よりも性能が悪く、モーメンタムが既に勾配の増大を効果的に制御している場合には、クリッピングが有益でないことが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。