[논문 리뷰] Effects of the Nonlinearity in Activation Functions on the Performance of Deep Learning Models
이 연구는 ReLU 및 Leaky-ReLU(L-ReLU) 활성화 함수의 비선형성이 다양한 아키텍처와 데이터 유형에서 딥러닝 모델 성능에 미치는 영향을 조사한다. MNIST, 연속형 및 FOOD-11 데이터셋을 사용하여, L-ReLU는 모델 파라미터가 제한된 경우에만 ReLU를 능가하며, 고파라미터 설정과 전이학습이 아닌 작업에서는 ReLU가 우월하고, 이미지 데이터를 사용한 전이학습 시나리오에서는 L-ReLU가 정확도를 향상시킨다.
The nonlinearity of activation functions used in deep learning models are crucial for the success of predictive models. There are several commonly used simple nonlinear functions, including Rectified Linear Unit (ReLU) and Leaky-ReLU (L-ReLU). In practice, these functions remarkably enhance the model accuracy. However, there is limited insight into the functionality of these nonlinear activation functions in terms of why certain models perform better than others. Here, we investigate the model performance when using ReLU or L-ReLU as activation functions in different model architectures and data domains. Interestingly, we found that the application of L-ReLU is mostly effective when the number of trainable parameters in a model is relatively small. Furthermore, we found that the image classification models seem to perform well with L-ReLU in fully connected layers, especially when pre-trained models such as the VGG-16 are used for the transfer learning.
연구 동기 및 목표
- 활성화 함수의 비선형성, 예를 들어 ReLU 및 L-ReLU가 딥러닝 모델 성능에 미치는 영향를 이해하는 것.
- 다양한 활성화 함수를 사용할 때 모델 아키텍처의 형태와 파라미터 수가 검증 정확도에 미치는 영향를 조사하는 것.
- 데이터 도메인(연속형, 이산형, 이미지)이 최적의 활성화 함수 선택에 미치는 영향를 평가하는 것.
- L-ReLU가 일반화 및 정보 흐름 측면에서 ReLU보다 우월한 조건를 탐색하는 것.
- L-ReLU의 비선형성 인자 α의 선택에 대한 경험적 통찰을 제공하여 모델 성능 향상에 기여하는 것.
제안 방법
- 성능에 대한 아키텍처 영향를 평가하기 위해 다양한 은닉층 노드 구성이 있는 다섯 가지 별도의 모델 아키텍처(A–E)를 사용하였다.
- 모든 아키텍처와 데이터셋에 대해 α(0에서 1 사이)를 다양하게 설정한 ReLU 및 L-ReLU를 적용하였다.
- 교차엔트로피 및 MSE 손실 함수를 사용하여 MNIST(손글씨 숫자), 시뮬레이션된 연속형 데이터, FOOD-11(이미지 분류) 데이터셋에서 모델을 훈련시켰다.
- 전이학습을 위해 사전 훈련된 VGG-16에서 뱃속 특징을 추출하고, 이를 완전히 연결된 네트워크의 입력으로 사용하였다. 다양한 활성화 함수를 적용하였다.
- 다양한 α 값과 데이터 유형에서 검증 정확도 및 검증 손실을 측정하여 성능을 측정하였다.
- 손실 행동과 α에 대한 모델 민감도를 관찰하여 정보 흐름을 분석하였으며, 특히 α=1과 같은 극단적 값에서의 특성을 중점적으로 분석하였다.
실험 결과
연구 질문
- RQ1ReLU와 L-ReLU 중 어떤 것을 선택하느냐가 다양한 모델 아키텍처에서 모델 정확도에 어떻게 영향을 미치는가?
- RQ2학습 가능한 파라미터 수가 L-ReLU가 ReLU보다 성능 우월성을 발휘할 수 있는지에 영향을 미치는가?
- RQ3데이터 도메인(예: 연속형, 이미지, 이산형)이 최적의 활성화 함수 선택에 어떻게 영향을 미치는가?
- RQ4특히 VGG-16과 같은 모델에서 사전 추출된 특징을 사용할 때, L-ReLU가 전이학습 환경에서 어떤 영향을 미치는가?
- RQ5α가 변할 때, 특히 α=1일 경우, 데이터 유형에 따라 검증 손실이 어떻게 다르게 행동하는가?
주요 결과
- 고파라미터 모델에서는 ReLU가 L-ReLU를 일관되게 능가하여, 모든 아키텍처에서 MNIST에서 최대 약 90%의 검증 정확도를 달성하였다.
- L-ReLU는 학습 가능한 파라미터 수가 상대적으로 적을 때에만 ReLU를 능가하는 성능 우위를 보였으며, 특히 얕거나 얇은 네트워크에서 두드러졌다.
- VGG-16 뱃속 특징을 사용한 FOOD-11 이미지 분류 작업에서는 α가 증가할수록 검증 손실이 감소하여, 이 전이학습 환경에서 L-ReLU가 ReLU를 능가함을 시사하였다.
- 연속형 데이터에서는 α=1일 때 검증 손실이 급격히 증가하여 약 10^4에 도달하여, 목표와 비선형적으로 관련된 특징에서는 ReLU의 강한 비선형성이 해로울 수 있음을 보여주었다.
- MNIST 모델에서는 α에 대한 의존도가 약했으며, ReLU(α=0)가 가장 낮은 검증 손실을 기록하여, 이 도메인에서는 ReLU의 강력한 비선형성이 특징 학습을 향상시킨다는 것을 시사하였다.
- 결과는 네트워크를 통과하는 정보 흐름이 활성화 함수의 비선형성에 의해 크게 영향을 받으며, 향후 이해를 향상시키기 위해 정보 흐름의 엔트로피 기반 측정법 도입이 유의미할 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.