[논문 리뷰] Mish: A Self Regularized Non-Monotonic Activation Function
이 논문은 f(x) = x·tanh(softplus(x))로 정의되는 자기 정규화형 비단조화 활성화 함수인 Mish을 소개한다. 이는 딥 네ural 네트워크에서 학습 동역학과 모델 성능을 향상시킨다. 실험 결과, 동일한 초모수와 아키텍처 조건에서 ImageNet-1k에서 ReLU 및 Leaky ReLU 대비 최대 1% 향상된 Top-1 정확도를 기록했으며, MS-COCO 객체 검출에서 AP50가 2.1% 향상되었다.
We propose $ extit{Mish}$, a novel self-regularized non-monotonic activation function which can be mathematically defined as: $f(x)=x anh(softplus(x))$. As activation functions play a crucial role in the performance and training dynamics in neural networks, we validated experimentally on several well-known benchmarks against the best combinations of architectures and activation functions. We also observe that data augmentation techniques have a favorable effect on benchmarks like ImageNet-1k and MS-COCO across multiple architectures. For example, Mish outperformed Leaky ReLU on YOLOv4 with a CSP-DarkNet-53 backbone on average precision ($AP_{50}^{val}$) by 2.1$\%$ in MS-COCO object detection and ReLU on ResNet-50 on ImageNet-1k in Top-1 accuracy by $\approx$1$\%$ while keeping all other network parameters and hyperparameters constant. Furthermore, we explore the mathematical formulation of Mish in relation with the Swish family of functions and propose an intuitive understanding on how the first derivative behavior may be acting as a regularizer helping the optimization of deep neural networks. Code is publicly available at https://github.com/digantamisra98/Mish.
연구 동기 및 목표
- 딥 네ural 네트워크에서 학습 동역학과 일반화 능력을 향상시키는 활성화 함수를 개발하는 것.
- ReLU 및 Leaky ReLU와 같은 단조화 활성화 함수의 한계를 해결하여 최적화 및 일반화를 방해할 수 있음을 다루는 것.
- 딥 러닝에서 비단조화적이고 부드러운 활성화 함수의 수학적 및 최적화적 이점을 탐구하는 것.
- Mish와 함께 데이터 증강 기법이 주요 컴퓨터 비전 벤치마크에서 성능에 미치는 영향을 평가하는 것.
- Mish의 도함수 행동이 암묵적 정규화의 형태로 작용하는지에 대한 이론적 및 실증적 통찰을 제공하는 것.
제안 방법
- f(x) = x·tanh(softplus(x))로 정의된 Mish를 제안하여 ReLU와 Swish의 특성을 결합하고 더 향상된 부드러움을 확보한다.
- 소프트플러스(x) = log(1 + exp(x))를 사용하여 ReLU의 부드러운 근사치를 제공함으로써 0에서의 미분 가능성을 확보한다.
- hyperbolic tangent을 활용해 비단조화성을 도입함으로써 더 복잡한 특징 표현을 가능하게 한다.
- Mish의 1차 도함수 분석을 통해 최적화 과정에서의 자기 정규화 효과를 설명한다.
- ImageNet-1k 및 MS-COCO에서 다양한 아키텍처(예: ResNet-50, CSP-DarkNet-53)를 대상으로 성능를 검증한다.
- 실험 전반에 걸쳐 일관되게 데이터 증강 기법을 적용하여 Mish와의 상호작용 효과를 평가한다.
실험 결과
연구 질문
- RQ1ImageNet-1k에서 Mish는 ReLU 및 Leaky ReLU와 비교해 Top-1 정확도에서 어떻게 성능을 내는가?
- RQ2MS-COCO에서 객체 검출 성능을 고려할 때, Mish는 평균 정밀도(AP50)를 얼마나 향상시키는가?
- RQ3Mish의 비단조화성 및 부드러운 성질이 딥 네ural 네트워크 최적화에 어떤 역할을 하는가?
- RQ4Mish는 데이터 증강 기법과 어떻게 상호작용하여 모델 일반화 능력을 향상시키는가?
- RQ5Mish의 도함수 행동은 암묵적 정규화의 형태로 해석될 수 있는가?
주요 결과
- ResNet-50을 사용해 ImageNet-1k에서 훈련할 때, 동일한 초모수 조건에서 ReLU 대비 Mish가 Top-1 정확도에서 1% 향상되었다.
- YOLOv4와 CSP-DarkNet-53를 사용한 MS-COCO에서, Mish는 Leaky ReLU 대비 AP50를 2.1% 향상시켰다.
- Mish의 비단조화성 및 부드러운 성질이 더 나은 최적화 동역학과 일반화 능력 향상에 기여한다.
- ImageNet-1k 및 MS-COCO에서 데이터 증강 기법은 Mish와 조합될 경우 성능 향상 효과를 더욱 강화시켰다.
- Mish의 1차 도함수는 훈련 안정성과 수렴 성능 향상에 기여할 수 있는 정규화 효과를 보이는 행동을 보였다.
- 아키텍처나 초모수 변경 없이도, 여러 벤치마크에서 기존 활성화 함수를 초월한 성능을 기록했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.