Skip to main content
QUICK REVIEW

[논문 리뷰] E-swish: Adjusting Activations to Different Network Depths

Eric Alcaide|arXiv (Cornell University)|2018. 01. 22.
Advanced Neural Network Applications참고 문헌 8인용 수 13
한 줄 요약

이 논문은 스케일링 파rameter $\beta$를 도입한 학습 가능한 활성화 함수인 E-swish를 제안하며, 이는 $ f(x) = \beta x \cdot \text{sigmoid}(x) $로 정의된다. 이는 Swish를 일반화한 것으로 간주된다. 실험 결과, E-swish는 CIFAR-10과 CIFAR-100에서 ReLU와 Swish를 모두 능가하며, WRN-10-2에서 ReLU보다 각각 1.5%와 4.6%의 정확도 향상을 기록했다. 최적의 $\beta$ 값은 $1 \leq \beta \leq 2$ 범위 내에 있다.

ABSTRACT

Activation functions have a notorious impact on neural networks on both training and testing the models against the desired problem. Currently, the most used activation function is the Rectified Linear Unit (ReLU). This paper introduces a new and novel activation function, closely related with the new activation $Swish = x * sigmoid(x)$ (Ramachandran et al., 2017) which generalizes it. We call the new activation $E-swish = βx * sigmoid(x)$. We show that E-swish outperforms many other well-known activations including both ReLU and Swish. For example, using E-swish provided 1.5% and 4.6% accuracy improvements on Cifar10 and Cifar100 respectively for the WRN 10-2 when compared to ReLU and 0.35% and 0.6% respectively when compared to Swish. The code to reproduce all our experiments can be found at https://github.com/EricAlcaide/E-swish

연구 동기 및 목표

  • 깊은 네트워크에서 ReLU와 Swish의 한계를 해결하기 위해 더 유연한 활성화 함수를 도입하기 위해.
  • Swish 함수를 학습 가능한 파rameter $\beta$로 스케일링할 경우 학습 동역학과 모델 정확도 향상 여부를 조사하기 위해.
  • 표준 CNN 아키텍처에서 ReLU의 즉각적인 대체로 E-swish를 평가하기 위해, 하이퍼파ram터 재조정 없이도 가능하도록 하기 위해.
  • 기울기 소실 또는 폭주를 방지하면서 성능 향상을 극대화할 수 있는 $\beta$의 최적 범위를 규명하기 위해.
  • 특히 WRN-16-4와 같은 깊은 모델에서 다양한 네트워크 깊이와 아키텍처에서 일관된 성능 향상 여부를 확인하기 위해.

제안 방법

  • E-swish를 $ f(x) = \beta x \cdot \text{sigmoid}(x) $로 제안하며, 이는 Swish의 일반화된 형태로 학습 가능한 스케일링 파arameter $\beta$를 포함한다.
  • E-swish의 해석적 기울기를 유도하여 $ f'(x) = f(x) + \sigma(x)(\beta - f(x)) $로 표현하며, 이는 $\beta$에 의존하고 비단조화적 성질을 가짐을 보여준다.
  • WRN-10-2와 WRN-16-4 아키텍처를 사용하여 CIFAR-10과 CIFAR-100에서 표준 학습 프로토콜(SGD, 학습률 스케줄)을 적용한다.
  • 정확한 비교를 위해 ReLU를 위해 설계된 동일한 하이퍼파aram터를 사용하며, 활성화 함수만 교체한다.
  • E-swish를 사용할 경우 더 깊은 네트워크 수렴을 가능하게 하기 위해 배치 정규화를 적용하여 학습을 안정화시킨다.
  • 다양한 $\beta$ 값(1.0에서 2.0)에 대해 성능을 검증하여 다양한 아키텍처와 데이터셋에 최적의 스케일링을 규명한다.

실험 결과

연구 질문

  • RQ1학습 가능한 파arameter $\beta$로 Swish 활성화 함수를 스케일링할 경우, 다양한 네트워크 깊이에서 ReLU와 Swish를 초월하는 일관된 성능 향상이 발생하는가?
  • RQ2기울기 소실 또는 폭주를 방지하면서 정확도를 극대화할 수 있는 $\beta$의 최적 범위는 무엇인가?
  • RQ3E-swish는 하이퍼파aram터 재조정 없이도 ReLU의 즉각적인 대체로 사용될 수 있으며, ReLU와 Swish를 모두 능가하는가?
  • RQ4WRN-16-4와 같은 더 깊은 아키텍처에서 E-swish는 CIFAR-100에서 ReLU와 Swish에 비해 어떻게 성능을 내는가?
  • RQ5E-swish의 비단조화적 성질이 더 깊은 네트워크에서 더 나은 기울기 흐름과 더 빠른 수렴을 이끌어내는가?

주요 결과

  • WRN-10-2에서 E-swish는 CIFAR-100에서 ReLU보다 1.5% 높은 테스트 정확도를 기록했으며, $\beta = 1.5$일 때 Swish보다 0.35% 높았다.
  • WRN-16-4에서 CIFAR-100에서 E-swish는 $\beta = 1.25$일 때 77.35%의 정확도를 기록했으며, ReLU(75.92%)보다 1.43% 높고 Swish보다 0.47% 높았다.
  • E-swish의 성능 향상은 여러 $\beta$ 값에서 일관되게 관찰되었으며, 최적 성능는 $1 \leq \beta \leq 2$ 범위에서 나타났다.
  • 높은 $\beta$ 값(예: $\beta = 2$)은 성능 저하를 초래하여 기울기 크기와 안정성 사이의 트레이드오���을 시사했다.
  • 하이퍼파aram터를 ReLU에 최적화한 경우에도 E-swish는 항상 ReLU와 Swish를 능가했으며, 이는 강건성과 일반화 능력을 보여준다.
  • E-swish의 비단조화적 성질과 부드러운 기울기 프로파일은 더 깊은 네트워크에서 향상된 학습 동역학과 더 나은 수렴을 이끌어냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.