Skip to main content
QUICK REVIEW

[論文レビュー] Temperature check: theory and practice for training models with softmax-cross-entropy losses

Atish Agarwala, Jeffrey Pennington|arXiv (Cornell University)|Oct 14, 2020
Domain Adaptation and Few-Shot Learning参考文献 32被引用数 13
ひとこと要約

この論文は、ソフトマックス交差エントロピー損失で訓練されるモデルの初期学習ダイナミクスの理論を構築し、逆温度 $\beta = 1/T$ が初期ログリットの大きさとは独立して、訓練速度と一般化性能に顕著な影響を与えることを示している。CIFAR10、ImageNet、IMDBにおける実験的結果から、$\beta$ を $[10^{-2}, 10^1]$ の範囲で調整することで性能が著しく向上することが判明し、最適な $\beta$ はしばしば 1 から大きく離れている。これは、温度がモデル性能の重要なハイパーパrameterであることを示唆している。

ABSTRACT

The softmax function combined with a cross-entropy loss is a principled approach to modeling probability distributions that has become ubiquitous in deep learning. The softmax function is defined by a lone hyperparameter, the temperature, that is commonly set to one or regarded as a way to tune model confidence after training; however, less is known about how the temperature impacts training dynamics or generalization performance. In this work we develop a theory of early learning for models trained with softmax-cross-entropy loss and show that the learning dynamics depend crucially on the inverse-temperature $β$ as well as the magnitude of the logits at initialization, $||β{\bf z}||_{2}$. We follow up these analytic results with a large-scale empirical study of a variety of model architectures trained on CIFAR10, ImageNet, and IMDB sentiment analysis. We find that generalization performance depends strongly on the temperature, but only weakly on the initial logit magnitude. We provide evidence that the dependence of generalization on $β$ is not due to changes in model confidence, but is a dynamical phenomenon. It follows that the addition of $β$ as a tunable hyperparameter is key to maximizing model performance. Although we find the optimal $β$ to be sensitive to the architecture, our results suggest that tuning $β$ over the range $10^{-2}$ to $10^1$ improves performance over all architectures studied. We find that smaller $β$ may lead to better peak performance at the cost of learning stability.

研究の動機と目的

  • ソフトマックス温度 $T$(またはその逆数 $\beta$)が、交差エントロピー損失で訓練される深層ニューラルネットワークの学習ダイナミクスと一般化性能に与える影響を理解すること。
  • $\beta$ の影響を初期ログリットの大きさ $\|\mathbf{Z}^0\|_2$ とは分離して、訓練性能に与える影響を解明すること。
  • 非単位温度 $\beta$ による一般化性能の向上が、モデルの自信の変化によるものか、それとも初期学習段階における動的要因によるものかを調査すること。
  • 理論的予測の実証的検証を通じて、学習時間スケールを特定し、多様なアーキテクチャとデータセットにおける最適な $\beta$ 範囲を同定すること。
  • $T=1$ の標準設定を超えて、$\beta$ を調整可能なハイパーパrameterとして確立し、モデル性能の顕著な向上を実現すること。

提案手法

  • 初期化周辺の線形化を用いた初期学習ダイナミクスの理論的分析。$\tilde{\eta} = \eta \beta^2$ による勾配スケーリングにより、$\beta$ の影響を分離する。
  • 2つの主要な時間スケールの導出:初期学習の開始を示す $\tau_z \sim \|\mathbf{Z}^0\|_2 / \tilde{\eta}$ と非線形性への逸脱を示す $\tau_{nl} \sim \beta / \tilde{\eta}$。
  • 相関付き初期化戦略を用い、$\beta$ と $\|\mathbf{Z}^0\|_2$ を独立に制御しながら、ニューラル接線カーネル $\hat{\Theta}$ を固定する。
  • SGD と JAX/Neural Tangles を用いた、Wide ResNet(CIFAR10)、ResNet-50(ImageNet)、GRUs(IMDB)における大規模な実験的評価。
  • $10^{-2}$ から $10^1$ の範囲で $\beta$ を体系的に変更し、訓練の安定性、収束速度、テスト精度を分析する。
  • 勾配の大きさと時間スケールを測定し、理論的予測の学習ダイナミクスへの整合性を検証する。

実験結果

リサーチクエスチョン

  • RQ1逆温度 $\beta$ は、ソフトマックス交差エントロピー損失で訓練されるモデルの初期学習の時間スケールにどのように影響を与えるか?
  • RQ2一般化性能は、$\beta$ と初期ログリットの大きさ $\|\mathbf{Z}^0\|_2$ のどちらに依存する程度が強いのか?
  • RQ3非単位 $\beta$ による一般化性能の向上は、モデルの自信の変化によるものか、それとも訓練中の動的要因によるものか?
  • RQ4多様なアーキテクチャとデータセットにおいて、性能を最大化するための最適な $\beta$ 範囲は何か?
  • RQ5安定した訓練を維持するために、学習率は $\beta$ にどのようにスケーリングすべきか? その結果、最適な $\beta$ は何か?

主な発見

  • 一般化性能は $\beta$ に強く依存しており、最適な値はしばしば 1 から大きく離れている。これは $\beta$ が重要なハイパーパrameterであることを示している。
  • 性能は初期ログリットの大きさ $\|\mathbf{Z}^0\|_2$ とはほとんど独立しているが、$\|\mathbf{Z}^0\|_2 \gg 1$ の場合にのみ性能が劣化する。
  • 小さい $\beta$ は初期学習を高速化し、ピーク性能を向上させる可能性があるが、バッチ正則化がなければ訓練の不安定性も増加する。
  • 最適な学習率は $\eta^* \sim 1/\beta$ に比例し、初期学習時間スケールは $\tau_z^* \sim \|\mathbf{Z}^0\|_2 / \beta$ に比例する。
  • 実験的結果から、$[10^{-2}, 10^1]$ の範囲で $\beta$ を調整することで一貫した性能向上が得られ、アーキテクチャに依存して最適な値は一意ではない。
  • 一般化性能が $\beta$ に依存する理由は動的現象に起因し、モデルの自信の変化によるものではない。アブレーションとキャリブレーション解析によりこれを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。