Skip to main content
QUICK REVIEW

[논문 리뷰] TanhSoft -- a family of activation functions combining Tanh and Softplus

Koushik Biswas, Sandeep Kumar|arXiv (Cornell University)|2020. 09. 08.
Advanced Neural Network Applications참고 문헌 26인용 수 4
한 줄 요약

이 논문은 tanh와 소프트플러스 성분을 네 개의 조정 가능한 초매개변수를 통해 조합한 새로운 활성화 함수 가족인 TanhSoft를 소개한다: $\tanh(\alpha x + \beta e^{\gamma x})\ln(\delta + e^x)$ . 초매개변수 조정을 통해 특정 TanhSoft 변종이 ReLU, Swish 및 기타 표준 활성화 함수를 능가하며, Inception-v3를 사용할 경우 CIFAR-100에서 최대 2.57% 높은 상위-1 정확도를 달성하고, DenseNet-169를 사용할 경우 1.24% 향상된 성능을 보였다.

ABSTRACT

Deep learning at its core, contains functions that are composition of a linear transformation with a non-linear function known as activation function. In past few years, there is an increasing interest in construction of novel activation functions resulting in better learning. In this work, we propose a family of novel activation functions, namely TanhSoft, with four undetermined hyper-parameters of the form tanh(αx+βe^{γx})ln(δ+e^x) and tune these hyper-parameters to obtain activation functions which are shown to outperform several well known activation functions. For instance, replacing ReLU with xtanh(0.6e^x)improves top-1 classification accuracy on CIFAR-10 by 0.46% for DenseNet-169 and 0.7% for Inception-v3 while with tanh(0.87x)ln(1 +e^x) top-1 classification accuracy on CIFAR-100 improves by 1.24% for DenseNet-169 and 2.57% for SimpleNet model.

연구 동기 및 목표

  • 기존 표준 함수를 초월해 딥러닝 성능을 향상시킬 수 있도록 체계적이고 초매개변수화된 활성화 함수 가족을 개발하는 것.
  • ReLU 및 기타 인기 있는 활성화 함수의 한계(예: 평균이 0이 아님, 죽은 ReLU 현상, 기울기 소실)를 보완하기 위해 더 유연한 비선형성을 도입하는 것.
  • 조정 가능한 매개변수를 가진 tanh와 소프트플러스 성분을 조합함으로써 딥 네트워크에서 더 우수한 일반화 및 수렴 성능를 달성할 수 있는지 탐색하는 것.
  • 다양한 아키텍처(DenseNet, Inception, MobileNet, WideResNet)를 대상으로 기준 데이터셋(CIFAR-10, CIFAR-100)에서 제안된 가족의 실증적 검증 수행

제안 방법

  • 네 개의 조정 가능한 초매개변수 $\alpha$, $\beta$, $\gamma$, $\delta$를 가진 새로운 활성화 함수 가족을 정의: $ f(x; \alpha, \beta, \gamma, \delta) = \tanh(\alpha x + \beta e^{\gamma x}) \ln(\delta + e^x) $ .
  • 표준 비전 벤치마크에서 성능을 극대화하는 $\alpha$, $\beta$, $\gamma$, $\delta$의 최적 구성 찾기 위해 체계적인 초매개변수 탐색 수행.
  • Adam 옵timizer와 표준 학습 프rotocol를 사용해 CIFAR-10 및 CIFAR-100에서 여러 딥러닝 모델(DenseNet-121, DenseNet-169, Inception-v3, SimpleNet, MobileNet, WideResNet)을 훈련.
  • 상위-1 및 상위-3 정확도 지표를 기반으로 최적으로 조정된 TanhSoft 변종이 ReLU, Leaky ReLU, ELU, Swish, Softplus와 비교하여 성능를 평가.
  • SimpleNet 아키텍처에서 개별 초매개변수(예: $\beta$ 및 $\gamma$)가 모델 정확도에 미치는 영향을 분석하기 위해 추론 실험 수행.
  • CIFAR-100에서 WideResNet-28-10에 대해 훈련 및 테스트 정확도/손실 곡선을 시각화하여 일반화 및 수렴 동역학 평가.

실험 결과

연구 질문

  • RQ1tanh와 소프트플러스 함수의 초매개변수화된 조합이 ReLU 및 Swish와 같은 기존 함수를 능가하는 활성화 함수를 도출할 수 있는가?
  • RQ2이론적 이미지 분류 벤치마크에서 최고 성능을 내는 데 기여하는 네 개의 초매개변수($\alpha$, $\beta$, $\gamma$, $\delta$)의 특정 값은 무엇인가?
  • RQ3제안된 TanhSoft 가족이 다양한 딥 네트워크 아키텍처에서 수렴 속도 및 최종 정확도 향상에 기여하는가?
  • RQ4여러 데이터셋(CIFAR-10, CIFAR-100)과 모델 유형에서 TanhSoft의 성능가 Swish 및 ReLU와 비교해 어떻게 되는가?
  • RQ5초매개변수화된 설계가 경험적 수정보다 더 체계적이고 효과적인 활성화 함수 탐색을 가능하게 하는가?

주요 결과

  • TanhSoft-1($\alpha = 0.87$)은 DenseNet-169를 사용할 경우 CIFAR-100에서 ReLU 대비 상위-1 정확도를 1.24% 향상시키고, SimpleNet를 사용할 경우 2.57% 향상시켰다.
  • TanhSoft-2($\beta = 0.6$, $\gamma = 1$)는 DenseNet-169를 사용할 경우 CIFAR-10에서 ReLU 대비 0.46% 높은 상위-1 정확도를 기록했고, Inception-v3를 사용할 경우 0.7% 향상되었다.
  • SimpleNet 모델에서 $\beta = 0.6$인 TanhSoft-2는 CIFAR-10에서 상위-1 정확도 92.23%를 달성했으며, ReLU(91.01%) 및 Swish(91.59%)를 모두 초월했다.
  • CIFAR-100에서 Inception-v3를 사용할 경우 TanhSoft-2는 상위-1 정확도 69.28%를 기록했고, ReLU(69.09%) 및 Swish(67.61%)를 모두 뛰어넘었다.
  • 최고의 TanhSoft 변종($\beta = 0.6$, $\gamma = 1$)은 SimpleNet에서 CIFAR-10에서 상위-1 정확도 92.23%를 달성해 다양한 아키텍처 간 강력한 일반화 능력을 보였다.
  • CIFAR-100에서 WideResNet-28-10의 훈련 곡선 분석 결과, TanhSoft-2는 ReLU 및 Swish보다 더 빠른 수렴 속도와 낮은 테스트 손실을 기록해 개선된 최적화 역학을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.