Skip to main content
QUICK REVIEW

[논문 리뷰] Temperature check: theory and practice for training models with softmax-cross-entropy losses

Atish Agarwala, Jeffrey Pennington|arXiv (Cornell University)|2020. 10. 14.
Domain Adaptation and Few-Shot Learning참고 문헌 32인용 수 13
한 줄 요약

이 논문은 소프트맥스-크로스엔트로피 손실로 훈련되는 모델에 대한 초기 학습 동역학 이론을 수립하며, 온도 역수 $\beta = 1/T$ 가 초기화된 로짓 크기와는 무관하게 훈련 속도와 일반화에 결정적인 영향을 미친다는 것을 보여준다. CIFAR10, ImageNet, IMDB에서의 실험 결과는 $\beta$ 를 $[10^{-2}, 10^1]$ 범위에서 조정할 경우 성능 향상이 뚜렷하게 나타나며, 최적의 $\beta$ 는 종종 1과는 거리가 먼 것으로 나타나, 온도가 모델 성능의 핵심 하이퍼파rameter임을 시사한다.

ABSTRACT

The softmax function combined with a cross-entropy loss is a principled approach to modeling probability distributions that has become ubiquitous in deep learning. The softmax function is defined by a lone hyperparameter, the temperature, that is commonly set to one or regarded as a way to tune model confidence after training; however, less is known about how the temperature impacts training dynamics or generalization performance. In this work we develop a theory of early learning for models trained with softmax-cross-entropy loss and show that the learning dynamics depend crucially on the inverse-temperature $β$ as well as the magnitude of the logits at initialization, $||β{\bf z}||_{2}$. We follow up these analytic results with a large-scale empirical study of a variety of model architectures trained on CIFAR10, ImageNet, and IMDB sentiment analysis. We find that generalization performance depends strongly on the temperature, but only weakly on the initial logit magnitude. We provide evidence that the dependence of generalization on $β$ is not due to changes in model confidence, but is a dynamical phenomenon. It follows that the addition of $β$ as a tunable hyperparameter is key to maximizing model performance. Although we find the optimal $β$ to be sensitive to the architecture, our results suggest that tuning $β$ over the range $10^{-2}$ to $10^1$ improves performance over all architectures studied. We find that smaller $β$ may lead to better peak performance at the cost of learning stability.

연구 동기 및 목표

  • 소프트맥스 온도 $T$ (또는 그 역수 $\beta$) 가 크로스엔트로피 손실로 훈련되는 딥 네URAL 네트워크의 학습 동역학과 일반화에 미치는 영향을 이해하는 것.
  • 학습 성능에 영향을 주는 $\beta$ 와 초기 로짓 크기 $\|\mathbf{Z}^0\|_2$ 의 영향을 분리하는 것.
  • 일반화 성능 향상이 온도 조정으로 인해 발생하는 것이 모델의 자신감 변화인지, 아니면 초기 훈련 단계에서의 역학적 효과 때문인지 탐구하는 것.
  • 학습 시간스케일에 대한 이론적 예측을 실증적으로 검증하고 다양한 아키텍처와 데이터셋에서 최적의 $\beta$ 범위를 규명하는 것.
  • $T=1$ 의 표준 설정을 초월해 성능을 크게 향상시킬 수 있는 조정 가능한 하이퍼파rameter로 $\beta$ 를 정립하는 것.

제안 방법

  • 초기화 근처에서 선형화를 활용한 초기 학습 동역학 이론적 분석을 수행하며, $\tilde{\eta} = \eta \beta^2$ 로 스케일링된 그래디언트를 사용해 $\beta$ 의 영향을 분리한다.
  • 두 가지 핵심 시간스케일 유도: 초기 학습 시작 시점에 대한 $\tau_z \sim \|\mathbf{Z}^0\|_2 / \tilde{\eta}$ 와 비선형성 발생 시점에 대한 $\tau_{nl} \sim \beta / \tilde{\eta}$.
  • 신경 탄성 커널 $\hat{\Theta}$ 를 그대로 유지하면서 $\beta$ 와 $\|\mathbf{Z}^0\|_2$ 를 독립적으로 제어할 수 있도록 상관관계가 있는 초기화 전략을 사용한다.
  • SGD 및 JAX/Neural Tangles를 사용하여 Wide ResNet(CIFAR10), ResNet-50(ImageNet), GRUs(IMDB)에서 대규모 실증 평가를 수행한다.
  • $10^{-2}$ 에서 $10^1$ 까지의 $\beta$ 를 체계적으로 분석하고, 훈련 안정성, 수렴 속도, 테스트 정확도를 분석한다.
  • 이론적 예측을 검증하기 위해 그래디언트 크기와 시간스케일을 측정하여 학습 동역학을 분석한다.

실험 결과

연구 질문

  • RQ1소프트맥스-크로스엔트로피 손실로 훈련되는 모델에서 온도 역수 $\beta$ 는 초기 학습의 시간스케일에 어떤 영향을 미치는가?
  • RQ2일반화 성능은 $\beta$ 에 의존하는 정도가 높은가, 아니면 초기 로짓 크기 $\|\mathbf{Z}^0\|_2$ 에 의존하는가?
  • RQ3비단 1이 아닌 $\beta$ 를 사용할 경우 일반화 성능 향상의 원인이 모델의 자신감 변화인지, 아니면 훈련 중 역학적 효과 때문인지?
  • RQ4다양한 아키텍처와 데이터셋에서 성능을 극대화하기 위한 $\beta$ 의 최적 범위는 무엇인가?
  • RQ5안정적인 훈련을 유지하기 위해 학습률는 $\beta$ 와 어떻게 스케일링되어야 하는가? 그 결과 최적의 $\beta$ 는 무엇인가?

주요 결과

  • 일반화 성능은 $\beta$ 에 크게 의존하며, 최적의 값은 종종 1과는 거리가 먼 것으로 나타나, $\beta$ 가 핵심 하이퍼파ram터임을 시사한다.
  • 초기 로짓 크기 $\|\mathbf{Z}^0\|_2$ 와는 거의 독립적이며, $\|\mathbf{Z}^0\|_2 \gg 1$ 인 경우에만 성능 저하가 발생한다.
  • 작은 $\beta$ 는 더 빠른 초기 학습과 높은 피크 성능를 유도하지만, 배치 정규화 없이 사용할 경우 훈련의 불안정성이 증가한다.
  • 최적의 학습률는 $\eta^* \sim 1/\beta$ 와 같이 스케일링되며, 초기 학습 시간스케일은 $\tau_z^* \sim \|\mathbf{Z}^0\|_2 / \beta$ 와 같다.
  • 실증 결과는 $[10^{-2}, 10^1]$ 범위에서 $\beta$ 를 조정할 경우 일관된 성능 향상이 나타나며, 모든 아키텍처에서 유일한 최적 값은 존재하지 않는 것으로 나타났다.
  • 일반화 성능에 대한 $\beta$ 의 영향은 모델 자신감 변화가 아닌 역학적 현상임을 분석 및 校정 분석을 통해 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.