Skip to main content
QUICK REVIEW

[논문 리뷰] EraseReLU: A Simple Way to Ease the Training of Deep Convolution Neural Networks

Xuanyi Dong, Guoliang Kang|arXiv (Cornell University)|2017. 09. 22.
Advanced Neural Network Applications참고 문헌 25인용 수 15
한 줄 요약

이 논문은 ResNet, Pre-Act ResNet, Wide ResNet, ResNeXt 등의 아키텍처에서 잔차 블록의 마지막 레이어에서 ReLU 활성화 함수를 제거하는 간단하면서도 효과적인 방법인 EraseReLU를 제안한다. 이 방법은 비선형성을 감소시키고 기울기 흐름을 향상시켜 매우 깊은 합성곱 신경망의 훈련과 성능을 향상시키며, 계산 비용을 증가시키지 않으면서도 상태의 최고 성능을 달성한다. 특히 ResNet-152를 사용할 경우 ImageNet-10%에서 1.4%의 상위-1 정확도 향상과 전체 ImageNet 데이터셋에서 0.6%의 향상을 기록한다.

ABSTRACT

For most state-of-the-art architectures, Rectified Linear Unit (ReLU) becomes a standard component accompanied with each layer. Although ReLU can ease the network training to an extent, the character of blocking negative values may suppress the propagation of useful information and leads to the difficulty of optimizing very deep Convolutional Neural Networks (CNNs). Moreover, stacking layers with nonlinear activations is hard to approximate the intrinsic linear transformations between feature representations. In this paper, we investigate the effect of erasing ReLUs of certain layers and apply it to various representative architectures following deterministic rules. It can ease the optimization and improve the generalization performance for very deep CNN models. We find two key factors being essential to the performance improvement: 1) the location where ReLU should be erased inside the basic module; 2) the proportion of basic modules to erase ReLU; We show that erasing the last ReLU layer of all basic modules in a network usually yields improved performance. In experiments, our approach successfully improves the performance of various representative architectures, and we report the improved results on SVHN, CIFAR-10/100, and ImageNet. Moreover, we achieve competitive single-model performance on CIFAR-100 with 16.53% error rate compared to state-of-the-art.

연구 동기 및 목표

  • 매우 깊은 CNN에서 비선형성 감소가 최적화를 용이하게 하고 일반화 성능을 향상시킬 수 있는지 조사하기 위해.
  • 잔차 블록에서 ReLU 레이어를 제거하면 기울기 억제 현상이 완화되고 훈련 역학이 향상되는지 확인하기 위해.
  • 성능 향상을 극대화하는 데 핵심이 되는 설계 요소—ReLU 제거 위치와 비율—를 규명하기 위해.
  • 계산 비용을 증가시키지 않고 다양한 최신 아키텍처에서 EraseReLU의 효과를 입증하기 위해.

제안 방법

  • EraseReLU는 잔차 블록의 각 마지막 레이어에서 ReLU 활성화 함수를 결정적으로 제거한다.
  • 이 방법은 아키텍처 간 동일한 규칙을 적용한다: 모든 기본 모듈의 마지막 레이어에서 ReLU를 제거한다.
  • ReLU를 제거한 모듈의 비율은 하이퍼파라미터로 조정되며, 일반적으로 100%가 최적의 성능을 낳는다.
  • 이 방법은 ResNet, Pre-Act ResNet, Wide ResNet, Inception-V2, ResNeXt 등의 다수 아키텍처에 균일하게 적용된다.
  • 이론적 분석을 통해 매우 깊은 네트워크에서 ReLU 레이어가 기울기 역전파를 억제함을 밝혔다.
  • 실험은 동일한 데이터 증강 및 전처리 방법을 사용하는 표준 훈련 프로토콜을 따르며 공정한 비교를 보장한다.

실험 결과

연구 질문

  • RQ1깊은 CNN의 특정 레이어에서 ReLU를 제거하면 일반화 성능과 훈련 안정성이 향상되는가?
  • RQ2잔차 블록 내에서 ReLU를 제거할 최적의 위치는 어디인가?
  • RQ3ReLU를 제거한 블록의 비율이 모델 정확도와 수렴 속도에 미치는 영향은 어떠한가?
  • RQ4EraseReLU는 FLOPs를 증가시키지 않고도 소규모(CIFAR) 및 대규모(ImageNet) 데이터셋에서 성능 향상을 이끌 수 있는가?
  • RQ5EraseReLU는 CIFAR-100 및 ImageNet과 같은 벤치마크 데이터셋에서 최신 기술 모델보다 뛰어나거나 동등한 성능을 내는가?

주요 결과

  • EraseReLU는 ImageNet-10%에서 ResNet-50의 상위-1 정확도를 1.4% 향상시키며, 전체 ImageNet 데이터셋에서는 0.6% 향상시켰다.
  • CIFAR-100에서 EraseReLU는 16.53%의 오차율을 기록하여 Pre-act ResNet-1001을 포함한 최신 기술 모델을 초월했다.
  • FLOPs를 증가시키지 않고도 여러 아키텍처에서 SVHN, CIFAR-10, CIFAR-100, ImageNet에서 성능 향상을 달성했다.
  • 모든 기본 모듈의 마지막 레이어에서 ReLU를 제거하는 것이 다른 설정보다 일관되게 더 좋은 성능을 낳는다.
  • 이 방법은 초기 훈련 에포크에서 더 빠른 수렴을 이끌어내며, 깊은 네트워크에서 기울기 억제 현상을 감소시킨다.
  • ImageNet-30%에서 25%의 ReLU 제거 비율을 사용할 경우 원본 모델과 유사한 성능을 달성하여 데이터셋 크기의 영향에 민감함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.