Skip to main content
QUICK REVIEW

[論文レビュー] Smooth activations and reproducibility in deep networks

Gil I. Shamir, Dong Lin|arXiv (Cornell University)|Oct 20, 2020
Advanced Neural Network Applications参考文献 32被引用数 7
ひとこと要約

本稿では、深層ネットワークにおける精度と再現性のトレードオフを改善することを目的とした、滑らかで単調な活性化関数の新規族、Smooth ReLU(SmeLU)を提案する。非滑らかな ReLU を SmeLU に置き換えることで、連続な勾配を保証し、収束安定性を向上させ、同じデータで訓練された同一モデル間の予測差を顕著に低減することを実証した。特に大規模および分散型学習環境において顕著な効果を示した。

ABSTRACT

Deep networks are gradually penetrating almost every domain in our lives due to their amazing success. However, with substantive performance accuracy improvements comes the price of \emph{irreproducibility}. Two identical models, trained on the exact same training dataset may exhibit large differences in predictions on individual examples even when average accuracy is similar, especially when trained on highly distributed parallel systems. The popular Rectified Linear Unit (ReLU) activation has been key to recent success of deep networks. We demonstrate, however, that ReLU is also a catalyzer to irreproducibility in deep networks. We show that not only can activations smoother than ReLU provide better accuracy, but they can also provide better accuracy-reproducibility tradeoffs. We propose a new family of activations; Smooth ReLU (\emph{SmeLU}), designed to give such better tradeoffs, while also keeping the mathematical expression simple, and thus implementation cheap. SmeLU is monotonic, mimics ReLU, while providing continuous gradients, yielding better reproducibility. We generalize SmeLU to give even more flexibility and then demonstrate that SmeLU and its generalized form are special cases of a more general methodology of REctified Smooth Continuous Unit (RESCU) activations. Empirical results demonstrate the superior accuracy-reproducibility tradeoffs with smooth activations, SmeLU in particular.

研究の動機と目的

  • 同じデータで訓練された同一モデルが個々の入力例に対して予測が乖離するという、深層学習における再現性の欠如という問題を解決すること。
  • ReLU がゼロにおける非滑らかで微分不能な勾配を持つことにより、訓練順序や最適化ダイナミクスへの感受性が増幅され、再現性の低下に寄与していることを特定すること。
  • ReLU の計算的単純性を維持しながら連続な勾配と向上した最適化安定性を実現する、滑らかな活性化関数の新クラス(SmeLU 及びその一般化)を開発すること。
  • 実験的に、SmeLU のような滑らかな活性化関数が、ReLU や他の一般的な滑らかな活性化関数(例:GELU、Swish、Mish)と比較して、多様な訓練設定およびデータセットにおいて、より優れた精度-再現性トレードオフを達成することを示すこと。

提案手法

  • SmeLU を提案する。これは、ReLU に対する微分可能で単調な近似であり、出力がゼロから線形に滑らかに移行する。滑らかさを制御する学習可能または固定の温度パrameter β を備える。
  • ReLU の計算効率を保ちつつ、連続な勾配を確保し、訓練順序や最適化経路への感受性を低減するように SmeLU を設計する。
  • REctified Smooth Continuous Unit(RESCU)フレームワークの下で SmeLU を一般化し、滑らかさ、非線形性、勾配挙動の間で柔軟なトレードオフを実現する。
  • SmeLU および他の活性化関数を、2 種類の設定で評価する:Adagrad とプログレッシブバリデーションを用いた大規模オンライン CTR 予測、およびデータオーグメンテーションとドロップアウトを用いた標準的な MNIST 分類(Adagrad と SGD)。
  • モデル初期化と訓練順序の関数として予測差(PD)を測定し、真のラベルに対して正規化された相対的 PD(Δ₁ʳ)を用いて再現性の欠如を定量化する。
  • 重み正規化とアブレーションスタディを用いて、最適化要因とは別に活性化関数の滑らかさの影響を隔離し、滑らかさそのものが再現性を向上させることを確認する。

実験結果

リサーチクエスチョン

  • RQ1ReLU の非滑らかさが、分散システムで訓練された深層ネットワークにおける予測の再現性の欠如に、どの程度寄与しているか?
  • RQ2滑らかな活性化関数は、計算コストを低く保ちながら、ReLU よりも優れた精度-再現性トレードオフを達成できるか?
  • RQ3GELU や Swish、Mish などの異なる滑らかな活性化関数は、多様な訓練設定において、予測差と精度の観点でどのように比較されるか?
  • RQ4精度と再現性の両面で、より複雑な滑らかな活性化関数を凌駆する、単純で効率的な活性化関数が存在するか?

主な発見

  • ReLU は高い再現性の欠如を示し、大規模 CTR 予測タスクでは平均して予測差(PD)が 12% を超える。
  • SmeLU は同じ大規模設定で相対的 PD を 5% 未満にまで低減し、精度を損なわず再現性の大幅な向上を示した。
  • MNIST データセットでは、Adagrad では ReLU が 10% 以上の相対的 PD を示し、SGD では 30% を超えた。一方、SmeLU や他の滑らかな活性化関数は PD を顕著に低減し、SmeLU は両方の指標で ReLU を上回った。
  • 滑らかな活性化関数の中で、SmeLU は GELU や Swish、Mish や TanhExp よりも精度と再現性のバランスに優れており、変動が大きい訓練環境において顕著な優位性を示した。
  • SmeLU のような滑らかな活性化関数は、重み正規化やクリッピングなしでも、予測差を顕著に低減しながら精度を維持または向上させた。これは、滑らかさそのものが安定性を向上させることを示唆している。
  • 結果として、SmeLU は単純で計算コストが低く、より複雑な滑らかな活性化関数と同等またはそれ以上の性能を示した。これは、SmeLU の設計が ReLU の効果的で実用的な代替手段であることを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。