Skip to main content
QUICK REVIEW

[논문 리뷰] Layer Folding: Neural Network Depth Reduction using Activation Linearization

Amir Ben Dror, Niv Zehngut|arXiv (Cornell University)|2021. 06. 17.
Advanced Neural Network Applications참고 문헌 63인용 수 4
한 줄 요약

이 논문은 비선형 활성화 함수를 연속된 합성곱 레이어 간에 제거하여 신경망의 깊이를 줄이는 Layer Folding 기법을 제안한다. 이를 통해 해당 레이어들을 하나의 더 큰 합성곱 레이어로 병합할 수 있으며, 이로 인해 이동 및 엣지 디바이스에서 최대 25%까지 지연 시간을 감소시킬 수 있다. 정확도 손실는 최소 0.5%에 불과하며, ImageNet 벤치마크에서 성능을 유지하거나 향상시킨다.

ABSTRACT

Despite the increasing prevalence of deep neural networks, their applicability in resource-constrained devices is limited due to their computational load. While modern devices exhibit a high level of parallelism, real-time latency is still highly dependent on networks' depth. Although recent works show that below a certain depth, the width of shallower networks must grow exponentially, we presume that neural networks typically exceed this minimal depth to accelerate convergence and incrementally increase accuracy. This motivates us to transform pre-trained deep networks that already exploit such advantages into shallower forms. We propose a method that learns whether non-linear activations can be removed, allowing to fold consecutive linear layers into one. We apply our method to networks pre-trained on CIFAR-10 and CIFAR-100 and find that they can all be transformed into shallower forms that share a similar depth. Finally, we use our method to provide more efficient alternatives to MobileNetV2 and EfficientNet-Lite architectures on the ImageNet classification task.

연구 동기 및 목표

  • 자원 제약이 있는 디바이스에서 깊은 신경망의 높은 지연 시간 문제를 해결하기 위해 정확도가 크게 떨어지지 않도록 네트워크 깊이를 줄이는 것.
  • 사전 학습된 깊은 네트워크가 표현 능력을 유지하면서도 더 얕고 효율적인 형태로 전환될 수 있는지 조사하는 것.
  • 성능을 유지할 수 있는 최소 깊이 기준(효용 비선형도, EDNL로 명명)을 규명하는 것.
  • 레이어 간의 ReLU 유사 활성화 함수를 학습하여 제거함으로써 깊이 감소를 가능하게 하고, 인접한 선형 레이어를 기능적으로 병합하는 방법을 개발하는 것.
  • MobileNetV2 및 EfficientNet-Lite와 같은 인기 있는 모바일 아키텍처에 대한 효율적인 대안을 제시하기 위해 활성화 함수 선형화를 통한 깊이 감소를 실현하는 것.

제안 방법

  • 연속된 합성곱 레이어 간의 비선형 ReLU6 활성화 함수 중에서 정확도 저하 없이 제거할 수 있는 것을 학습하는 기법을 제안한다.
  • 중간 비선형성을 제거함으로써 연속된 선형 레이어를 하나의 등가 레이어로 접기하는 것을 공식적으로 정의하며, 이로 인해 커널 크기가 $k \times k$에서 $(2k-1) \times (2k-1)$로 증가한다.
  • 원래 네트워크의 중간 표현을 유지하는 피니팅 단계에 이 방법을 적용하여 다시 학습할 필요 없이 구현할 수 있다.
  • 쌍으로 이루어진 ReLU6 활성화 함수에 공유 가능한 학습 가능한 파라미터 $\alpha$를 사용하여 둘 다 제거되거나 둘 다 유지되도록 하여 블록 단위로 일관된 접기를 가능하게 한다.
  • MobileNetV2 및 EfficientNet-Lite의 전체 MBConv 블록에 이 방법을 적용하여, 확장, 디프웨이즈, 프로젝션 레이어를 하나의 합성곱 레이어로 병합한다. 이는 두 ReLU6 활성화 함수가 모두 제거된 경우에 해당한다.
  • 특히 높은 내부 레이어 병렬 처리 능력을 지닌 가속기 및 GPU에서 유리한, 하드웨어 인식 지연 최적화를 통해 레이어 간 계산 오버헤드를 우선적으로 줄인다.

실험 결과

연구 질문

  • RQ1사전 학습된 깊은 신경망이 비선형 활성화 함수를 제거함으로써 정확도 저하 없이 더 얕은 형태로 전환될 수 있는가?
  • RQ2주어진 작업에서 성능을 유지하기 위해 필요한 최소 깊이(효용 비선형도, EDNL)는 얼마이며, 다양한 아키텍처 간에 일관된가?
  • RQ3연속된 합성곱 레이어 간의 중간 ReLU6 활성화 함수를 제거함으로써 레이어의 기능적 병합이 가능해지고 엣지 디바이스에서 지연 시간이 감소하는가?
  • RQ4기존의 프루닝 및 재파arameterization 기법과 비교할 때, 제안된 Layer Folding 기법은 효율성과 정확도의 상호 보완적 관계에서 어떤 성능을 보이는가?
  • RQ5이 방법은 MobileNetV2 및 EfficientNet-Lite와 같은 최신 모바일 아키텍처에 효과적으로 적용되어 FLOPs 증가가 최소화되면서도 더 빠른 추론을 가능하게 하는가?

주요 결과

  • Layer Folding은 ImageNet 분류 작업에서 추론 지연 시간을 최대 25%까지 감소시킨다. 특히 MobileNetV2-1.0 및 MobileNetV2-1.4에서 가장 뚜렷한 성능 향상을 보였다.
  • MobileNetV2-0.75보다 1.2% 높은 정확도를 확보하면서도 14% 더 빠른 성능을 보이며, 효율성-정확도의 균형이 향상됨을 입증했다.
  • MobileNetV2-1.4에서 지연 시간은 19% 감소하고 FLOPs는 3% 감소했으며, 정확도 손실는 오직 0.5%에 불과하여 실용성 면에서 높은 잠재력을 보였다.
  • EfficientNet-Lite0에서는 지연 시간이 15% 감소했고, FLOPs는 3% 감소했으며 정확도 손실는 0.5%에 머물렀다. 이는 다양한 아키텍처에 널리 적용 가능함을 시사한다.
  • 확장 계수 $t=6$인 블록에서 두 ReLU6 활성화 함수를 제거함으로써 MBConv 블록 전체를 접는 것은 계산 부담을 절반으로 줄였다. 이는 세 개의 합성곱 레이어를 하나의 레이어로 병합했기 때문이다.
  • 이 방법은 비록 일부 경우(예: $c \gg 9$일 때)에는 FLOPs가 약간 증가할 수 있지만, 레이어 간 오버헤드 감소로 인해 하드웨어 가속기에서는 네트워크 전체 지연 시간이 감소하는 유리한 상호보완적 관계를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.