Skip to main content
QUICK REVIEW

[논문 리뷰] Activate or Not: Learning Customized Activation

Ningning Ma, Xiangyu Zhang|arXiv (Cornell University)|2020. 09. 10.
Advanced Neural Network Applications참고 문헌 58인용 수 9
한 줄 요약

이 논문은 뉴런을 활성화할지 여부를 동적으로 결정할 수 있는 학습 가능한 활성화 함수 ACON을 제안한다. 이는 다양한 모델에서 성능을 향상시킨다. Maxout을 부드럽고 미분 가능한 함수로 근사함으로써 ACON은 ReLU와 Swish를 능가하며, MobileNet-0.25와 ResNet-152에서 각각 6.7%와 1.8%의 상위-1 정확도 향상을 달성한다. 메타-ACON을 통해 활성화 스위치를 명시적으로 학습함으로써 추가적인 성능 향상을 이룬다.

ABSTRACT

We present a simple, effective, and general activation function we term ACON which learns to activate the neurons or not. Interestingly, we find Swish, the recent popular NAS-searched activation, can be interpreted as a smooth approximation to ReLU. Intuitively, in the same way, we approximate the more general Maxout family to our novel ACON family, which remarkably improves the performance and makes Swish a special case of ACON. Next, we present meta-ACON, which explicitly learns to optimize the parameter switching between non-linear (activate) and linear (inactivate) and provides a new design space. By simply changing the activation function, we show its effectiveness on both small models and highly optimized large models (e.g. it improves the ImageNet top-1 accuracy rate by 6.7% and 1.8% on MobileNet-0.25 and ResNet-152, respectively). Moreover, our novel ACON can be naturally transferred to object detection and semantic segmentation, showing that ACON is an effective alternative in a variety of tasks. Code is available at https://github.com/nmaac/acon.

연구 동기 및 목표

  • NAS로 탐색된 Swish의 메커니즘을 이해하고 이를 향상시키기 위해.
  • Maxout 가족의 활성화 함수에 대해 일반적이고 부드럽고 학습 가능한 근사치를 개발하기 위해.
  • 선형 및 비선형 행동 간의 전환을 명시적으로 학습하는 활성화 함수를 설계하기 위해.
  • 추가적인 계산 비용 없이도 소형, 대형 및 고도로 최적화된 모델에서 성능을 향상시키기 위해.
  • 제안된 활성화 함수가 객체 검출 및 세분화 작업으로의 일반화 성능을 입증하기 위해.

제안 방법

  • Maxout에 대한 부드럽고 미분 가능한 근사치로 ACON을 제안하며, Swish는 특수 케이스로 포함된다.
  • 고정된 경계의 한계를 극복하기 위해 기울기 내에서 학습 가능한 상한과 하한을 도입한다.
  • 값이 0으로 감쇠하는 스위칭 인자 설계를 통해 비선형과 선형 행동 간의 동적 전환을 가능하게 한다.
  • 메타-학습자를 통해 활성화 결정을 명시적으로 학습함으로써 학습 안정성을 향상시키는 메타-ACON을 개발한다.
  • MobileNet, ResNet, RetinaNet, PSPNet 등 다양한 아키텍처에 ACON과 메타-ACON을 적용한다.
  • 백본 네트워크에서 ReLU를 메타-ACON으로 교체함으로써 ACON을 객체 검출 및 세분화 작업으로 이식한다.

실험 결과

연구 질문

  • RQ1NAS로 탐색된 Swish 활성화 함수는 어떻게 작동하며, 이를 ReLU에 대한 부드러운 근사치로 해석할 수 있는가?
  • RQ2Maxout 가족을 일반화하여 성능 향상을 이룰 수 있는 부드럽고 학습 가능한 활성화 함수로 만들 수 있는가?
  • RQ3선형과 비선형 행동 간의 학습 가능한 전환 메커니즘이 모델 정확도를 향상시킬 수 있는가?
  • RQ4활성화 결정을 명시적으로 학습하는 메타-ACON이 스위칭 인자에 대한 표준 기울기 기반 최적화를 능가하는가?
  • RQ5ACON은 객체 검출 및 세분화와 같은 다양한 작업으로 효과적으로 이식될 수 있는가?

주요 결과

  • ACON은 ReLU 대비 MobileNet-0.25에서 ImageNet 상위-1 정확도를 6.7% 향상시키고, ResNet-152에서는 1.8% 향상시켰다.
  • 메타-ACON은 ResNet-152에서 1.3% 향상되고 SENet-154에서는 1.7% 향상되어 Swish와 SENet를 능가했다.
  • COCO 객체 검출에서 메타-ACON은 36.5 mAP를 기록하여 ReLU 대비 1.3점 향상되고 Swish 대비 0.7점 향상되었다.
  • CityScape에서의 세분화 작업에서 메타-ACON은 평균 IU 78.3을 기록하여 ReLU 대비 1.1점 향상되고 Swish 대비 0.8점 향상되었다.
  • ACON은 소형 모델(예: MobileNet-0.25)과 대형, 고도로 최적화된 모델(예: ResNet-152, SENet-154) 모두에서 일관된 성능 향상을 보였다.
  • 이 방법은 일반화 성능가 뛰어나 계산 오버헤드가 없으며, 검출 및 세분화 작업으로 이식 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.