Skip to main content
QUICK REVIEW

[논문 리뷰] Flexible Rectified Linear Units for Improving Convolutional Neural Networks

Suo Qiu, Bolun Cai|arXiv (Cornell University)|2017. 06. 25.
Advanced Neural Network Applications참고 문헌 18인용 수 7
한 줄 요약

이 논문은 유연한 정류된 선형 단위(FReLU)를 제안한다. FReLU는 고정된 영점으로서의 ReLU를 대체하는 학습 가능한 활성화 함수로, 음수 값을 활용함으로써 네트워크 표현력을 향상시킨다. FReLU는 평탄한 네트워크와 잔차 네트워크 모두에서 CIFAR-10, CIFAR-100, ImageNet에서 ReLU보다 더 빠른 수렴 속도와 높은 정확도를 달성하며, 계산 비용은 최소한으로 유지된다.

ABSTRACT

Rectified linear unit (ReLU) is a widely used activation function for deep convolutional neural networks. However, because of the zero-hard rectification, ReLU networks miss the benefits from negative values. In this paper, we propose a novel activation function called \emph{flexible rectified linear unit (FReLU)} to further explore the effects of negative values. By redesigning the rectified point of ReLU as a learnable parameter, FReLU expands the states of the activation output. When the network is successfully trained, FReLU tends to converge to a negative value, which improves the expressiveness and thus the performance. Furthermore, FReLU is designed to be simple and effective without exponential functions to maintain low cost computation. For being able to easily used in various network architectures, FReLU does not rely on strict assumptions by self-adaption. We evaluate FReLU on three standard image classification datasets, including CIFAR-10, CIFAR-100, and ImageNet. Experimental results show that the proposed method achieves fast convergence and higher performances on both plain and residual networks.

연구 동기 및 목표

  • ReLU의 고정된 영점 정류 방식이 음수 값을 폐기함으로써 네트워크 표현력에 제한을 둔다는 문제를 해결하기 위해.
  • 딥 컨volution 신경망에서 학습 가능한 활성화 임계값이 특징 표현과 모델 성능 향상에 기여하는지 탐색하기 위해.
  • 낮은 계산 비용을 유지하면서도 정규화 지점의 적응적 학습을 가능하게 하는 단순하고 효율적인 활성화 함수를 설계하기 위해.
  • 다양한 네트워크 아키텍처와 기준 데이터셋에서 제안된 FReLU의 일반화 능력과 효과성을 평가하기 위해.

제안 방법

  • FReLU는 음수 값이 잘리기 시작하는 지점을 제어하는 학습 가능한 파라미터를 도입함으로써 ReLU 활성화 함수를 수정한다.
  • 활성화 함수는 FReLU(x) = max(αx, 0)로 정의되며, 여기서 α는 백프로파게이션 동안 최적화되는 학습 가능한 스칼라 파라미터이다.
  • 학습 가능한 파라미터 α는 엔드 투 엔드 방식으로 최적화되어 네트워크가 최적의 정규화 임계값을 자동으로 결정하도록 한다.
  • 계산 효율성과 기존 딥 러닝 프레임워크와의 호환성을 유지하기 위해 지수 함수를 포함하지 않도록 설계되었다.
  • 일반 네트워크와 잔차 네트워크 아키텍처에 모두 적용하여 다양한 모델 설계에서의 일반화 능력을 평가한다.
  • 표준 백프로파게이션을 사용하며, 네트워크 가중치와 α 파라미터 모두에 대해 기울기 업데이트를 수행한다.

실험 결과

연구 질문

  • RQ1학습 가능한 임계값을 갖는 ReLU 활성화 함수가 고정된 ReLU보다 딥 컨volution 신경망의 성능을 향상시킬 수 있는가?
  • RQ2학습 가능한 정규화 지점 덕분에 음수 값이 기여함으로써 특징 표현과 모델 표현력이 향상되는가?
  • RQ3표준 이미지 분류 벤치마크에서 FReLU의 수렴 속도와 최종 정확도는 어떻게 평가되는가?
  • RQ4FReLU는 평탄한 네트워크와 잔차 네트워크와 같은 다양한 네트워크 아키텍처에 얼마나 잘 일반화되는가?
  • RQ5활성화 함수에 학습 가능한 파라미터를 포함시키면 상당한 계산 비용이 증가하는가?

주요 결과

  • 모든 평가된 데이터셋에서 FReLU는 표준 ReLU보다 더 빠른 수렴 속도를 기록한다.
  • CIFAR-10에서 FReLU는 평탄한 네트워크와 잔차 네트워크 모두에서 ReLU보다 상위-1 정확도를 향상시키며, 실험에서 측정 가능한 성능 향상이 확인된다.
  • CIFAR-100에서는 FReLU가 일관된 성능 향상을 보이며, 더 복잡한 분류 작업에서도 강건함을 입증한다.
  • ImageNet에서는 FReLU가 ReLU보다 더 높은 정확도를 달성하면서도 수렴 속도가 빠르며, 대규모 데이터셋에 대한 확장성도 확인한다.
  • FReLU의 학습된 파라미터 α는 학습 도중 음수 값으로 수렴하는 경향이 있어, 네트워크가 음수 활성화를 활용함으로써 유의미한 이점을 얻는다.
  • 지수 함수가 없기 때문에 FReLU는 낮은 계산 비용을 유지하여 자원 제약 환경에서의 구현에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.