[논문 리뷰] Activate or Not: Learning Customized Activation
이 논문은 뉴런을 활성화할지 여부를 동적으로 결정할 수 있는 학습 가능한 활성화 함수 ACON을 제안한다. 이는 다양한 모델에서 성능을 향상시킨다. Maxout을 부드럽고 미분 가능한 함수로 근사함으로써 ACON은 ReLU와 Swish를 능가하며, MobileNet-0.25와 ResNet-152에서 각각 6.7%와 1.8%의 상위-1 정확도 향상을 달성한다. 메타-ACON을 통해 활성화 스위치를 명시적으로 학습함으로써 추가적인 성능 향상을 이룬다.
We present a simple, effective, and general activation function we term ACON which learns to activate the neurons or not. Interestingly, we find Swish, the recent popular NAS-searched activation, can be interpreted as a smooth approximation to ReLU. Intuitively, in the same way, we approximate the more general Maxout family to our novel ACON family, which remarkably improves the performance and makes Swish a special case of ACON. Next, we present meta-ACON, which explicitly learns to optimize the parameter switching between non-linear (activate) and linear (inactivate) and provides a new design space. By simply changing the activation function, we show its effectiveness on both small models and highly optimized large models (e.g. it improves the ImageNet top-1 accuracy rate by 6.7% and 1.8% on MobileNet-0.25 and ResNet-152, respectively). Moreover, our novel ACON can be naturally transferred to object detection and semantic segmentation, showing that ACON is an effective alternative in a variety of tasks. Code is available at https://github.com/nmaac/acon.
연구 동기 및 목표
- NAS로 탐색된 Swish의 메커니즘을 이해하고 이를 향상시키기 위해.
- Maxout 가족의 활성화 함수에 대해 일반적이고 부드럽고 학습 가능한 근사치를 개발하기 위해.
- 선형 및 비선형 행동 간의 전환을 명시적으로 학습하는 활성화 함수를 설계하기 위해.
- 추가적인 계산 비용 없이도 소형, 대형 및 고도로 최적화된 모델에서 성능을 향상시키기 위해.
- 제안된 활성화 함수가 객체 검출 및 세분화 작업으로의 일반화 성능을 입증하기 위해.
제안 방법
- Maxout에 대한 부드럽고 미분 가능한 근사치로 ACON을 제안하며, Swish는 특수 케이스로 포함된다.
- 고정된 경계의 한계를 극복하기 위해 기울기 내에서 학습 가능한 상한과 하한을 도입한다.
- 값이 0으로 감쇠하는 스위칭 인자 설계를 통해 비선형과 선형 행동 간의 동적 전환을 가능하게 한다.
- 메타-학습자를 통해 활성화 결정을 명시적으로 학습함으로써 학습 안정성을 향상시키는 메타-ACON을 개발한다.
- MobileNet, ResNet, RetinaNet, PSPNet 등 다양한 아키텍처에 ACON과 메타-ACON을 적용한다.
- 백본 네트워크에서 ReLU를 메타-ACON으로 교체함으로써 ACON을 객체 검출 및 세분화 작업으로 이식한다.
실험 결과
연구 질문
- RQ1NAS로 탐색된 Swish 활성화 함수는 어떻게 작동하며, 이를 ReLU에 대한 부드러운 근사치로 해석할 수 있는가?
- RQ2Maxout 가족을 일반화하여 성능 향상을 이룰 수 있는 부드럽고 학습 가능한 활성화 함수로 만들 수 있는가?
- RQ3선형과 비선형 행동 간의 학습 가능한 전환 메커니즘이 모델 정확도를 향상시킬 수 있는가?
- RQ4활성화 결정을 명시적으로 학습하는 메타-ACON이 스위칭 인자에 대한 표준 기울기 기반 최적화를 능가하는가?
- RQ5ACON은 객체 검출 및 세분화와 같은 다양한 작업으로 효과적으로 이식될 수 있는가?
주요 결과
- ACON은 ReLU 대비 MobileNet-0.25에서 ImageNet 상위-1 정확도를 6.7% 향상시키고, ResNet-152에서는 1.8% 향상시켰다.
- 메타-ACON은 ResNet-152에서 1.3% 향상되고 SENet-154에서는 1.7% 향상되어 Swish와 SENet를 능가했다.
- COCO 객체 검출에서 메타-ACON은 36.5 mAP를 기록하여 ReLU 대비 1.3점 향상되고 Swish 대비 0.7점 향상되었다.
- CityScape에서의 세분화 작업에서 메타-ACON은 평균 IU 78.3을 기록하여 ReLU 대비 1.1점 향상되고 Swish 대비 0.8점 향상되었다.
- ACON은 소형 모델(예: MobileNet-0.25)과 대형, 고도로 최적화된 모델(예: ResNet-152, SENet-154) 모두에서 일관된 성능 향상을 보였다.
- 이 방법은 일반화 성능가 뛰어나 계산 오버헤드가 없으며, 검출 및 세분화 작업으로 이식 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.