[논문 리뷰] Learning Activation Functions to Improve Deep Neural Networks
이 논문은 각 뉴런이 기울기 하강법을 통해 매개변수화된 조각별 선형 형태를 사용해 자체 활성화 함수를 학습하는 적응형 조각별 선형(Adaptive Piecewise Linear, APL) 활성화 함수를 제안한다. 이 방법은 CIFAR-10(7.51% 오차), CIFAR-100(30.83% 오차), 그리고 고에너지 물리학 분야의 힉스 보손 붕괴 작업에서 최신 기준 성능을 달성하여 고정된 활성화 함수와 이전 베이스라인을 모두 능가한다.
Artificial neural networks typically have a fixed, non-linear activation function at each neuron. We have designed a novel form of piecewise linear activation function that is learned independently for each neuron using gradient descent. With this adaptive activation function, we are able to improve upon deep neural network architectures composed of static rectified linear units, achieving state-of-the-art performance on CIFAR-10 (7.51%), CIFAR-100 (30.83%), and a benchmark from high-energy physics involving Higgs boson decay modes.
연구 동기 및 목표
- 딥 네ural 네트워크에서 고정된 수작업 설계된 활성화 함수의 한계를 해결하기 위해.
- 학습 중 활성화 함수를 학습하는 것이 일반화 및 성능 향상에 기여하는지 조사하기 위해.
- 볼록 및 비볼록 조각별 선형 함수를 모두 표현할 수 있는 유연하고 미분 가능한 활성화 함수를 개발하기 위해.
- 적응형 활성화 함수가 표준 벤치마크와 실제 과학적 응용에 미치는 영향을 평가하기 위해.
- 개별화된, 학습된 활성화 함수가 더 높은 모델 표현력과 훈련 성과를 이끌어내는지 증명하기 위해.
제안 방법
- 각 뉴런의 활성화 함수는 히든형 ReLU 유닛들의 합으로 정의된다: $ h_i(x) = \max(0,x) + \sum_{s=1}^{S} a_i^s \max(0, -x + b_i^s) $.
- 매개변수 $ a_i^s $ 및 $ b_i^s $ 는 네트워크 가중치와 함께 표준 역전파를 통해 학습된다.
- 히든 구성 요소의 수 $ S $ 는 하이퍼파rameter이며, 주요 실험에서는 $ S=2 $ 를 사용한다.
- 약한 점 渐진적 조건 하에서, 이 함수는 임의의 연속적인 조각별 선형 함수를 근사할 수 있다.
- Maxout이나 ReLU와 달리, 이 방법은 볼록 및 비볼록 활성화 형태 모두를 지원한다.
- 추가 매개변수의 수는 $ 2SM $ 으로 총 네트워크 매개변수에 비해 작다.
실험 결과
연구 질문
- RQ1뉴런별로 활성화 함수를 학습하는 것이 표준 벤치마크에서 딥 네럴 네트워크 성능 향상에 기여하는가?
- RQ2비볼록 활성화 함수를 학습할 수 있는 능력이 고정 또는 Maxout 스타일 활성화 함수보다 더 나은 일반화를 이끌어내는가?
- RQ3히든 구성 요소 수 $ S $ 가 모델 성능과 표현력에 어떤 영향을 미치는가?
- RQ4학습된 활성화 함수가 계층과 데이터셋 간에 상당한 차이를 보이며, 다양한 기능 적응을 나타내는가?
- RQ5적응형 활성화 함수가 힉스 보손 붕괴 모드 분류와 같은 실제 과학적 응용에서 성능 향상에 기여하는가?
주요 결과
- APL 기반 네트워크는 CIFAR-10에서 테스트 오차 7.51%를 기록하여 ReLU 기반 베이스라인 및 앙상블 방법을 능가했다.
- CIFAR-100에서 APL 모델은 30.83%의 오차율을 기록하여 이전 최고 기록을 크게 향상시켰다.
- 고에너지 물리학 분야의 힉스 보손 붕괴 작업에서 APL 모델은 AUC 0.804와 발견의미 3.41σ를 기록하여 ReLU 기반 베이스라인 및 앙상블 모델을 초월했다.
- 초기화 시 학습된 활성화 함수를 冻결한 경우 오차율이 12.55%로 약간 뿐이었으며, 이는 학습이 성능 향상에 필수적임을 보여준다.
- 히든 구성 요소 수 $ S=5 $ 가 CIFAR-100에서 최고의 성능(오차율 11.38%)을 기록했고, $ S=10 $ 는 약간의 성능 저하를 보였다.
- 시각화 결과는 CIFAR-100 및 힉스 작업에서 계층 간에 학습된 활성화 함수의 변동성이 더 크며, 깊이가 깊어질수록 변동성이 감소하는 경향을 보였고, 이는 계층별 적응을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.