Skip to main content
QUICK REVIEW

[논문 리뷰] Is it Time to Swish? Comparing Deep Learning Activation Functions Across NLP tasks

Steffen Eger, Paul Youssef|arXiv (Cornell University)|2019. 01. 09.
Adversarial Robustness in Machine Learning인용 수 5
한 줄 요약

이 논문은 다층퍼셉트론(MLP), 컨volution 신경망(CNN), 순환신경망(RNN)을 사용하여 8개의 NLP 작업을 대상으로 21개의 활성화 함수에 대한 최초의 대규모 실험적 비교를 수행한다. 그 결과, 페널라이즈드 탄젠트 함수가 안정성과 일반화 능력에서 다른 함수들을 능가하며, 어려운 시퀀스 태깅 작업에서 LSTM 셀의 표준 시그모이드/탄젠트 게이트를 대체할 경우 표준 활성화 함수보다 2%포인트 향상된 성능을 기록한다.

ABSTRACT

Activation functions play a crucial role in neural networks because they are the nonlinearities which have been attributed to the success story of deep learning. One of the currently most popular activation functions is ReLU, but several competitors have recently been proposed or 'discovered', including LReLU functions and swish. While most works compare newly proposed activation functions on few tasks (usually from image classification) and against few competitors (usually ReLU), we perform the first large-scale comparison of 21 activation functions across eight different NLP tasks. We find that a largely unknown activation function performs most stably across all tasks, the so-called penalized tanh function. We also show that it can successfully replace the sigmoid and tanh gates in LSTM cells, leading to a 2 percentage point (pp) improvement over the standard choices on a challenging NLP task.

연구 동기 및 목표

  • 다양한 NLP 작업과 아키텍처를 통해 활성화 함수에 대한 대규모 실험적 평가가 부족한 문제를 해결하기 위해.
  • 최근 제안된 활성화 함수들(예: 스위시)이 이미지 분류를 넘어 NLP로 일반화되는지 조사하기 위해.
  • 다양한 NLP 작업과 하이퍼파라미터 설정에서 안정적으로 성능을 내는 활성화 함수를 특정하기 위해.
  • 포화 특성을 띤 함수들(예: 페널라이즈드 탄젠트)이 LSTM 게이팅 메커니즘에서 시그모이드 및 탄젠트 함수를 성공적으로 대체할 수 있는지 평가하기 위해.
  • 깊이 및 드롭아웃과 같은 하이퍼파라미터가 활성화 함수 성능에 미치는 영향을 평가하기 위해.

제안 방법

  • 문장 분류, 문서 분류, 시퀀스 태깅에 걸쳐 8개의 NLP 작업에서 21개의 활성화 함수를 평가하였다.
  • 표준 NLP 아키텍처 3종을 사용: 다층퍼셉트론(MLP), 컨volution 신경망(CNN), 순환신경망(RNN).
  • 안정성을 평가하기 위해 하이퍼파라미터 설정에 따른 최상의 정확도와 평균 성능을 비교하였다.
  • 하이퍼파라미터(예: 레이어 수, 드롭아웃 비율)가 활성화 함수 성능에 미치는 영향을 모델링하기 위해 회귀 분 析를 수행하였다.
  • LSTM 셀의 표준 시그모이드 및 탄젠트 게이트를 페널라이즈드 탄젠트로 대체하고, 어려운 시퀀스 태깅 벤치마크에서 성능을 평가하였다.
  • Ramachandran 등(2017)이 제안한 자동 탐색 기반 함수(예: 스위시 포함)를 활용하고, 표준 및 신규 대안과 비교하였다.

실험 결과

연구 질문

  • RQ1다양한 NLP 작업과 아키텍처에서 가장 안정적으로 성능을 내는 활성화 함수는 무엇인가?
  • RQ2이미지 분류에서 자동 탐색을 통해 발견된 활성화 함수(예: 스위시)는 NLP 작업으로 일반화되는가?
  • RQ3포화 특성을 띤 함수들(예: 페널라이즈드 탄젠트)은 LSTM 게이팅 메커니즘에서 시그모이드 및 탄젠트 함수를 성공적으로 대체할 수 있는가?
  • RQ4네트워크 깊이 및 드롭아웃과 같은 하이퍼파라미터는 다양한 활성화 함수의 상대적 성능에 어떻게 영향을 미치는가?
  • RQ5NLP 모델에서 하이퍼파라미터 설정에 따라 최고 성능와 안정성 사이에 트레이드오프가 존재하는가?

주요 결과

  • 페널라이즈드 탄젠트 함수는 모든 8개의 NLP 작업에서 가장 안정적인 성능을 기록하였으며, 일관성 면에서 다른 함수들을 압도하였다.
  • 어려운 시퀀스 태깅 작업에서 LSTM 셀의 표준 시그모이드 및 탄젠트 게이트를 페널라이즈드 탄젠트로 대체함으로써 성능이 2%포인트 향상되었다.
  • 스위시는 여러 작업에서 양호한 성능를 보였지만, 페널라이즈드 탄젠트보다 안정성이 떨어졌고, 항상 상위 성능를 기록하지 못했다.
  • Ramachandran 등(2017)이 제안한 자동 탐색을 통해 발견된 대부분의 활성화 함수는 NLP 작업으로 일반화되지 못했으며, 스위시를 제외한 모든 함수가 실패했다.
  • 유한한 범위를 가지는 포화 특성을 띤 함수들(예: 페널라이즈드 탄젠트)은 하이퍼파라미터 설정 전반에서 뛰어난 안정성을 보였고, 비포화 특성을 가진 함수들은 높은 최고 성능를 기록했지만 일관성은 떨어졌다.
  • 활성화 함수의 성능는 사전에 예측할 수 없었으며, 하이퍼파라미터 민감도는 함수 간에 크게 달랐다. 특히 페널라이즈드 탄젠트와 스위시는 깊이 및 드롭아웃에 대해 더 뛰어난 내구성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.