Skip to main content
QUICK REVIEW

[논문 리뷰] FReLU: Flexible Rectified Linear Units for Improving Convolutional Neural Networks

Suo Qiu, Xiangmin Xu|arXiv (Cornell University)|2017. 06. 25.
Advanced Neural Network Applications인용 수 7
한 줄 요약

이 논문은 유연한 음성 활성화를 가능하게 하기 위해 학습 가능한 편향 파라미터를 도입함으로써 ReLU를 확장한 학습 가능한 활성화 함수인 FReLU를 제안한다. 이는 계산 비용을 증가시키지 않으면서 모델의 표현력을 향상시킨다. FReLU는 CIFAR-10, CIFAR-100, ImageNet 벤치마크에서 ReLU, PReLU, ELU, SReLU보다 더 빠른 수렴 속도와 높은 정확도를 달성한다. 특히 배치 정규화와 함께 사용할 경우 두드러진 성능 향상을 보인다.

ABSTRACT

Rectified linear unit (ReLU) is a widely used activation function for deep convolutional neural networks. However, because of the zero-hard rectification, ReLU networks miss the benefits from negative values. In this paper, we propose a novel activation function called \emph{flexible rectified linear unit (FReLU)} to further explore the effects of negative values. By redesigning the rectified point of ReLU as a learnable parameter, FReLU expands the states of the activation output. When the network is successfully trained, FReLU tends to converge to a negative value, which improves the expressiveness and thus the performance. Furthermore, FReLU is designed to be simple and effective without exponential functions to maintain low cost computation. For being able to easily used in various network architectures, FReLU does not rely on strict assumptions by self-adaption. We evaluate FReLU on three standard image classification datasets, including CIFAR-10, CIFAR-100, and ImageNet. Experimental results show that the proposed method achieves fast convergence and higher performances on both plain and residual networks.

연구 동기 및 목표

  • 학습 가능한 리커티피케이션 포인트를 도입하여 ReLU의 한계인 음성 정보 누락 및 중심이 0이 아닌 활성화 문제를 해결하기 위해.
  • 통제된 음성 활성화를 통해 컨volutional 신경망의 표현력과 일반화 능력을 향상시키기 위해.
  • 계산 효율성과 배치 정규화와의 호환성을 유지하는 활성화 함수를 설계하기 위해.
  • 음성 값이 네트워크 성능에 의미적으로 기여한다는 것을 경험적으로 검증하기 위해.

제안 방법

  • FReLU는 유연한 수직 이동을 가능하게 하기 위해 ReLU를 수정하여 학습 가능한 편향 파라미터 $ b_l $ 를 도입한다. 수식은 다음과 같다: $ frelu(x) = \begin{cases} x + b_l & \text{if } x > 0 \\ b_l & \text{if } x \leq 0 \end{cases} $.
  • 학습 가능한 파라미터 $ b_l $ 는 네트워크와 함께 엔드 투 엔드로 학습되며, 활성화 임계값의 적응적 조정이 가능하다.
  • 전방 및 역방향 전파 과정은 지수 함수와 같은 고비용 연산을 피하여 계산적으로 효율적이다.
  • FReLU는 배치 정규화와 호환되며, 아키텍처 수정이 필요하지 않다.
  • 이 방법은 평탄한 네트워크와 잔차 연결 네트워크 모두에 적용 가능하며, ResNet 및 NIN 아키텍처에 적용된다.
  • 기울기 소실을 방지하기 위해 대칭 가중치 초기화 전략을 활용하여 철저한 파라미터 초기화를 설계하였다.

실험 결과

연구 질문

  • RQ1ReLU에 학습 가능한 편향을 도입함으로써 통제된 음성 활성화를 가능하게 하여 모델 성능 향상을 이룰 수 있는가?
  • RQ2표준 이미지 분류 데이터셋에서 FReLU가 ReLU, PReLU, ELU, SReLU보다 정확도와 수렴 속도 측면에서 뛰어난 성능을 보일 수 있는가?
  • RQ3FReLU는 ELU와 비교해 배치 정규화와 함께 사용했을 때 어떻게 성능을 발휘하는가?
  • RQ4FReLU는 희소성나 계산 비용을 희생시키지 않고도 유의미한 음성 정보를 효과적으로 포착할 수 있는가?
  • RQ5FReLU의 자가 적응적 특성 덕분에 강한 가정 없이 다양한 네트워크 아키텍처에 일반화될 수 있는가?

주요 결과

  • NIN 모델을 사용한 CIFAR-10에서 FReLU는 테스트 오차 7.30% (±0.20)를 기록하여 ReLU(8.05%), PReLU(8.86%), ELU(8.08%), SReLU(7.93%)를 모두 앞서며 성능을 뛰어넘었다.
  • NIN을 사용한 CIFAR-100에서 FReLU는 테스트 오차 28.47% (±0.21)를 기록하여 ReLU(29.46%), PReLU(33.73%), ELU(28.33%)보다 유의미하게 뛰어났다.
  • CIFAR-10의 ResNet-110에서 FReLU는 테스트 오차 6.20% (±0.23)를 기록하여 원래 아키텍처를 사용한 ReLU(6.82%)와 ELU(8.21%)를 모두 앞섰다.
  • 수정된 잔차 블록을 적용한 경우, FReLU는 CIFAR-100의 ResNet-110에서 오차 5.71%를 기록하여 ELU(5.86%)와 ReLU(28.48%)를 모두 능가했다.
  • ImageNet에서 FReLU는 NIN에서 top-1 오차를 ReLU의 35.65%에서 34.82%로 감소시켰으며, CaffeNet의 최고 성능 51.20%를 달성하여 ELU(51.20%)와 ReLU(53.00%)를 모두 능가했다.
  • FReLU는 ELU보다 더 빠른 수렴 속도를 보였고, 배치 정규화와의 호환성도 더 우수하여, 잔차 블록에 직접 대체했을 때 성능 저하가 발생하지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.