[논문 리뷰] Rethink ReLU to Training Better CNNs
이 논문은 CNN의 표준 1:1 컨볼루션-ReLU 쌍을 N:M 비율(N > M)로 대체하는 비례 모듈을 제안한다. 이는 ReLU 활성화 함수의 수 대비 컨볼루션 레이어의 수를 늘려, 불필요한 ReLU 유닛을 제거함으로써 특징 표현과 일반화 성능을 향상시키되, 계산 비용을 증가시키지 않는다. 이 방법은 ResNet 및 DFN을 포함한 다양한 아키텍처에서 CIFAR-10/100 및 ImageNet 벤치마크에서 최신 기술 수준의 성능을 달성한다.
Most of convolutional neural networks share the same characteristic: each convolutional layer is followed by a nonlinear activation layer where Rectified Linear Unit (ReLU) is the most widely used. In this paper, we argue that the designed structure with the equal ratio between these two layers may not be the best choice since it could result in the poor generalization ability. Thus, we try to investigate a more suitable method on using ReLU to explore the better network architectures. Specifically, we propose a proportional module to keep the ratio between convolution and ReLU amount to be N:M (N>M). The proportional module can be applied in almost all networks with no extra computational cost to improve the performance. Comprehensive experimental results indicate that the proposed method achieves better performance on different benchmarks with different network architectures, thus verify the superiority of our work.
연구 동기 및 목표
- CNN에서 컨볼루션 레이어와 ReLU 레이어 간의 표준 1:1 비율이 일반화 성능에 최적인지 여부를 조사하는 것.
- 딥 네트워크에서 ReLU의 과잉으로 인해 성능 포화 현상이 발생할 수 있는 문제를 다루는 것.
- 선형 정보를 ReLU가 제거하는 것을 방지하면서도 특징 표현을 향상시키는 유연하고 계산 비용이 효율적인 모듈을 제안하는 것.
- ResNet, DFN, 평범한 네트워크와 같은 다양한 아키텍처에서 비례 모듈의 효과를 검증하는 것.
- 더 나은 CNN 아키텍처 개발을 위한 일반적인 설계 원칙을 제공하는 것.
제안 방법
- 컨볼루션 레이어와 ReLU 레이어 간에 N:M 비율(N > M)을 가지는 비례 모듈을 제안하여 ReLU 과잉을 줄이는 것.
- 표준 잔차 블록에서 첫 번째 ReLU를 제거함으로써 2:1 비례 모듈을 적용하여 선형 변환을 유지하는 것.
- FLOPs나 파라미터 수를 늘리지 않고 ResNet, DFN, 평범한 네트워크와 같은 기존 아키텍처에 비례 모듈을 통합하는 것.
- CONV-BN-CONV-BN-ReLU의 순서를 2:1 비례 모듈로 사용하여 특징 학습과 정규화를 향상시키는 것.
- CIFAR-10/100 및 ImageNet을 포함한 다양한 벤치마크에서 성능을 평가하여 일반화 및 내성 강도를 분석하는 것.
- ablative 연구를 통해 ReLU 배치의 영향을 분석하고, 특히 잔차 블록의 최종 ReLU의 중요성을 규명하는 것.
실험 결과
연구 질문
- RQ1딥 CNN에서 ReLU 유닛의 수를 줄이면 일반화 성능이 향상되는가?
- RQ2예를 들어 2:1 비율처럼 컨볼루션 레이어와 ReLU 레이어 간에 비균형적인 비율을 적용하면 표준 1:1 쌍보다 더 나은 특징 표현이 가능한가?
- RQ3초기 ReLU를 제거하면 잔차 블록의 학습 능력과 성능에 어떤 영향을 미치는가?
- RQ4제안된 비례 모듈은 ResNet 및 DFN과 같은 다양한 네트워크 아키텍처에서 효과적인가?
- RQ5잔차 블록 내에서 다양한 ReLU 위치의 상대적 중요도는 모델 성능에 어떤 영향을 미치는가?
주요 결과
- 2:1 비례 모듈(첫 번째 ReLU 제거)은 기준값 75.59%에서 CIFAR-100의 정확도를 75.61%로 약간 향상시켰다. 변동성이 매우 작았다.
- CIFAR-10에서는 기준값 95.04%에서 95.26%로 정확도가 향상되어 다양한 데이터셋에서 일관된 개선을 보였다.
- ResNet 및 DFN 모델에서 비례 모듈이 기준값을 초월하여 성능을 높여, 광범위한 적용 가능성을 입증했다.
- 프리-액티베이션 볼티지 블록에서 최종 ReLU가 성능에 가장 큰 영향을 미쳤다. 이는 비선형 변환에서의 역할을 시사한다.
- 머지-앤드-런 블록에서 첫 번째 ReLU가 원소 덧셈 이후의 ReLU보다 더 중요했으며, 이는 블록 수준의 비선형성에서의 기여를 강조한다.
- 계산 비용을 증가시키지 않으면서도 성능 향상을 이룬 점에서, 비례 모듈의 효율성과 실용성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.