[논문 리뷰] Smooth activations and reproducibility in deep networks
이 논문은 딥 네트워크에서 정확도-재현 가능성 간 상충 관계를 개선하기 위해 설계된 새로운 부드럽고 단조적인 활성화 함수인 SmeLU(Smooth ReLU)를 제안한다. 비부드러운 ReLU를 대체함으로써 SmeLU는 연속적인 기울기를 보장하고 수렴 안정성을 향상시킨다. 저자들은 동일한 데이터로 훈련된 동일한 모델 간 예측 차이를 크게 줄였음을 입증하였으며, 특히 대규모 및 분산 훈련 환경에서 두드러진다.
Deep networks are gradually penetrating almost every domain in our lives due to their amazing success. However, with substantive performance accuracy improvements comes the price of \emph{irreproducibility}. Two identical models, trained on the exact same training dataset may exhibit large differences in predictions on individual examples even when average accuracy is similar, especially when trained on highly distributed parallel systems. The popular Rectified Linear Unit (ReLU) activation has been key to recent success of deep networks. We demonstrate, however, that ReLU is also a catalyzer to irreproducibility in deep networks. We show that not only can activations smoother than ReLU provide better accuracy, but they can also provide better accuracy-reproducibility tradeoffs. We propose a new family of activations; Smooth ReLU (\emph{SmeLU}), designed to give such better tradeoffs, while also keeping the mathematical expression simple, and thus implementation cheap. SmeLU is monotonic, mimics ReLU, while providing continuous gradients, yielding better reproducibility. We generalize SmeLU to give even more flexibility and then demonstrate that SmeLU and its generalized form are special cases of a more general methodology of REctified Smooth Continuous Unit (RESCU) activations. Empirical results demonstrate the superior accuracy-reproducibility tradeoffs with smooth activations, SmeLU in particular.
연구 동기 및 목표
- 동일한 데이터로 훈련된 동일한 모델가 개별 예측에서 분리된 결과를 보이는 딥 러닝의 점점 악화되는 재현 불가능성 문제를 해결한다.
- ReLU가 0에서 비부드럽고 미분 불가능한 기울기를 가지므로, 훈련 순서와 최적화 역학에 대한 민감도를 증폭시켜 재현 불가능성의 주요 원인임을 규명한다.
- ReLU의 계산적 단순성은 유지하면서도 연속적인 기울기를 보장하고 최적화 안정성을 향상시키는 새로운 부드러운 활성화 함수의 클래스—SmeLU 및 그 일반화된 형태—를 개발한다.
- 다양한 훈련 설정과 데이터셋에서 ReLU 및 기타 인기 있는 부드러운 활성화 함수(GELU, Swish, Mish 등)와 비교하여 SmeLU와 같은 부드러운 활성화 함수가 정확도-재현 가능성 간 상충 관계에서 뛰어난 성능을 보임을 경험적으로 입증한다.
제안 방법
- SmeLU를 제안하며, 이는 ReLU에 대한 미분 가능하고 단조적인 근사로, 0에서 선형 출력으로 부드럽게 전이되며, 부드러움을 제어하는 학습 가능한 또는 고정된 온도 유사 매개변수 β를 가진다.
- SmeLU는 ReLU의 계산 효율성을 유지하면서도 연속적인 기울기를 보장함으로써, 훈련 순서와 최적화 경로에 대한 민감도를 감소시킨다.
- REctified Smooth Continuous Unit(RESCU) 프레임워크 하에 SmeLU를 일반화하여, 부드러움, 비선형성, 기울기 행동 간의 다양한 트레이드오프를 가능하게 하는 더 넓은 활성화 함수의 가족을 설계한다.
- SmeLU 및 기타 활성화 함수를 두 가지 설정에서 평가한다: Adagrad와 점진적 검증을 사용한 대규모 온라인 CTR 예측, Adagrad와 데이터 증강 및 드롭아웃을 사용한 표준 MNIST 분류.
- 모델 초기화와 훈련 순서에 따른 예측 차이(PD)를 측정하며, 진짜 레이블에 대해 정규화된 상대적 PD(Δ₁ʳ)를 사용하여 재현 불가능성을 정량화한다.
- 가중치 정규화와 아블레이션 연구를 통해 활성화의 부드러움 외의 최적화 요소들로부터 영향을 분리함으로써, 부드러움 자체가 재현 가능성을 향상시킴을 확인한다.
실험 결과
연구 질문
- RQ1ReLU의 비부드러움이 분산 시스템에서 훈련된 딥 네트워크에서 예측 재현 불가능성에 얼마나 기여하는가?
- RQ2부드러운 활성화 함수는 낮은 계산 비용을 유지하면서도 ReLU보다 더 나은 정확도-재현 가능성 트레이드오프를 달성할 수 있는가?
- RQ3다양한 훈련 구성에서 SmeLU, GELU, Swish, Mish 등의 다양한 부드러운 활성화 함수가 예측 차이와 정확도 측면에서 어떻게 비교되는가?
- RQ4정확도와 재현 가능성 양면에서 더 복잡한 부드러운 활성화 함수보다 성능을 맞추거나 능가하는 단순하고 효율적인 활성화 함수가 존재하는가?
주요 결과
- ReLU는 대규모 CTR 예측 작업에서 평균적으로 12%를 초과하는 상대적 예측 차이(PD)를 보이며 높은 재현 불가능성을 보였다. 이는 모델이 동일하게 초기화된 경우에도 마찬가지였다.
- 같은 대규모 설정에서 SmeLU는 상대적 PD를 5% 이하로 낮춰 재현 가능성에서 뚜렷한 향상을 보였다. 정확도 손실 없이 이루어진 것이다.
- MNIST 데이터셋에서 Adagrad 하에서는 ReLU가 10% 이상의 상대적 PD를 보였고, SGD 하에서는 30% 이상이었다. 반면 SmeLU 및 기타 부드러운 활성화 함수는 PD를 크게 감소시켰으며, SmeLU는 두 지표에서 모두 ReLU를 능가했다.
- 부드러운 활성화 함수들 중에서 SmeLU는 특히 고변동성 훈련 환경에서 GELU, Swish, Mish, TanhExp와 비교해 정확도와 재현 가능성의 균형을 더 잘 달성했다.
- SmeLU와 같은 부드러운 활성화 함수는 가중치 정규화나 클리핑 없이도 정확도를 유지하거나 향상시키면서도 예측 차이를 극적으로 줄였다. 이는 부드러움 자체가 안정성을 향상시킴을 시사한다.
- 단순하고 계산 비용이 낮은 SmeLU는 더 복잡한 부드러운 활성화 함수와 비교해도 성능이 비슷하거나 뛰어나며, 이는 SmeLU의 설계가 ReLU에 대한 효과적이고 실용적인 대체제임을 검증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.