Skip to main content
QUICK REVIEW

[논문 리뷰] Be Careful What You Backpropagate: A Case For Linear Output Activations & Gradient Boosting

Anders Øland, Aayush Bansal|arXiv (Cornell University)|2017. 07. 13.
Advanced Neural Network Applications참고 문헌 18인용 수 9
한 줄 요약

이 논문은 다층 신경망에서 소프트맥스 대신 선형 출력 활성화를 사용할 경우 학습 수렴 속도와 일반화 성능이 향상됨을 주장한다. 정규화를 제거하고 오직 지수형 경사 하강 강화(gradient boosting)만 유지함으로써 학습 속도가 빨라지며, PASCAL VOC 2012 세그멘테이션 작업에서 표준 소프트맥스 대비 33% 빠른 수렴을 달성하면서 정확도도 향상시켜, 다중 클래스 분류에서 오랫동안 사용되어온 소프트맥스의 사용에 도전한다.

ABSTRACT

In this work, we show that saturating output activation functions, such as the softmax, impede learning on a number of standard classification tasks. Moreover, we present results showing that the utility of softmax does not stem from the normalization, as some have speculated. In fact, the normalization makes things worse. Rather, the advantage is in the exponentiation of error gradients. This exponential gradient boosting is shown to speed up convergence and improve generalization. To this end, we demonstrate faster convergence and better performance on diverse classification tasks: image classification using CIFAR-10 and ImageNet, and semantic segmentation using PASCAL VOC 2012. In the latter case, using the state-of-the-art neural network architecture, the model converged 33% faster with our method (roughly two days of training less) than with the standard softmax activation, and with a slightly better performance to boot.

연구 동기 및 목표

  • 소프트맥스와 같이 포화되는 출력 활성화가 깊은 신경망의 학습을 저해하는지 여부를 조사하는 것.
  • 소프트맥스의 이점이 정규화에서 기인하는지, 아니면 지수형 경사 하강 강화에서 기인하는지 규명하는 것.
  • 간단한 대안인 선형 출력 활성화와 지수형 경사 하강 강화(exp-GB)를 제안하고 평가하는 것.
  • 오차 표면의 비볼록성 감소가 최적화 효율성과 모델 일반화를 향상시킨다는 것을 입증하는 것.

제안 방법

  • 표준 소프트맥스 출력 활성화를 선형 출력에 이어지는 지수형 경사 하강 강화(exp-GB)로 대체하는 것.
  • 출력 활성화로 항등함수를 사용하여 포화와 정규화를 방지하는 것.
  • 오차 기울기에 지수형 강화를 적용: ∇L/∇x = exp(y − t), 여기서 y는 원시 출력이고 t는 타겟이다.
  • 표준 소프트맥스 및 pow3-GB(세제곱 강화)와 같은 다른 비선형 함수와의 학습 동역학과 성능을 비교하는 것.
  • 헤시안 행렬을 사용하여 오차 표면의 이阶 성질을 분석하여 더 빠른 수렴을 설명하는 것.
  • CIFAR-10, ImageNet, PASCAL VOC 2012에서 모델을 훈련시켜 방법의 실증적 타당성을 검증하는 것.

실험 결과

연구 질문

  • RQ1소프트맥스 사용이 깊은 신경망에서 학습 수렴과 일반화를 저해하는가?
  • RQ2소프트맥스의 이점은 정규화에서 기인하는가, 아니면 지수형 경사 하강 강화에서 기인하는가?
  • RQ3소프트맥스를 선형 출력과 지수형 경사 하강 강화로 대체할 경우 학습 속도와 정확도가 향상되는가?
  • RQ4exp-GB를 사용할 경우 오차 표면의 곡률은 소프트맥스와 비교해 어떻게 변화하는가?
  • RQ5소프트맥스의 정규화 항 s = ∑i exp(xi)가 기울기 크기와 최적화 동역학에 미치는 영향은 무엇인가?

주요 결과

  • PASCAL VOC 2012 세그멘테이션 작업에서 제안된 방법은 표준 소프트맥스 대비 33% 빠른 수렴을 달성했다.
  • 지수형 경사 하강 강화를 사용한 모델은 표준 소프트맥스 기준선보다 略적으로 더 높은 성능을 보였다.
  • 소프트맥스의 정규화 항 s = ∑i exp(xi)는 훈련 중에 단조적으로 증가했으며, 10층의 CIFAR-10 모델에서 2,342에 도달했다.
  • 이론적 분석에서 exp-GB는 소프트맥스보다 더 큰 헤시안(곡률)을 가지며, 최소점 근처에서 더 빠른 수렴을 이끌어내는 것으로 나타났다.
  • 소프트맥스의 정규화를 제거하면서도 지수형 경사 하강 강화를 유지함으로써 추가 하이퍼파rameter 조정 없이도 학습 동역학이 향상되었다.
  • 결과는 소프트맥스의 주요 이점이 정규화가 아니라 지수형 경사 하강 강화에 기인하며, 이는 학습 속도를 가속화한다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.