Skip to main content
QUICK REVIEW

[논문 리뷰] RMNet: Equivalently Removing Residual Connection from Networks

Fanxu Meng, Hao Cheng|arXiv (Cornell University)|2021. 11. 01.
Advanced Neural Network Applications인용 수 9
한 줄 요약

이 논문은 ResNet 및 MobileNetV2와 같은 깊은 네트워크에서 잔차 연결을 등가적으로 제거하기 위한 RMNet을 제안한다. 이는 입력 특징 맵을 유지하고 블록 출력과 병합하는 '예약 및 병합(RM)' 연산을 도입함으로써, 정확도 손실 없이 단일 브랜치, VGG 유사 아키텍처를 가능하게 한다. RMNet는 최신 정확도-속도 트레이드오프를 달성하며, RMNet 152×6_32는 ImageNet에서 80.36%의 Top-1 정확도를 기록하여 ResNet-101과 RepVGG B2를 초월한다. 또한 양질의 프루닝과 추론 최적화에 매우 적합하다.

ABSTRACT

Although residual connection enables training very deep neural networks, it is not friendly for online inference due to its multi-branch topology. This encourages many researchers to work on designing DNNs without residual connections at inference. For example, RepVGG re-parameterizes multi-branch topology to a VGG-like (single-branch) model when deploying, showing great performance when the network is relatively shallow. However, RepVGG can not transform ResNet to VGG equivalently because re-parameterizing methods can only be applied to linear blocks and the non-linear layers (ReLU) have to be put outside of the residual connection which results in limited representation ability, especially for deeper networks. In this paper, we aim to remedy this problem and propose to remove the residual connection in a vanilla ResNet equivalently by a reserving and merging (RM) operation on ResBlock. Specifically, the RM operation allows input feature maps to pass through the block while reserving their information and merges all the information at the end of each block, which can remove residual connections without changing the original output. As a plug-in method, RM Operation basically has three advantages: 1) its implementation makes it naturally friendly for high ratio network pruning. 2) it helps break the depth limitation of RepVGG. 3) it leads to better accuracy-speed trade-off network (RMNet) compared to ResNet and RepVGG. We believe the ideology of RM Operation can inspire many insights on model design for the community in the future. Code is available at: https://github.com/fxmeng/RMNet.

연구 동기 및 목표

  • 온라인 추론에서 다중 브랜치 아키텍처로 인해 효율성이 떨어지는 잔차 연결의 문제를 해결하기 위해.
  • 깊은 네트워크에서 잔차 블록 내 비선형 레이어를 처리하지 못하는 재패러미터라이제이션 기법(예: RepVGG)의 한계를 극복하기 위해.
  • 사전 훈련된 ResNet 및 MobileNetV2 모델을 정확도 저하 없이 단순한 단일 브랜치 아키텍처로 변환할 수 있도록 하기 위해.
  • 정확도-속도 트레이드오프를 향상시키고, 네트워크 프루닝 및 고비율 모델 압축과의 호환성을 높이기 위해.
  • 더 깊은 네트워크에서 잔차 연결을 제거함으로써 성능을 유지하거나 향상시킬 수 있는 잠재력을 탐색하기 위해.

제안 방법

  • ResBlock의 첫 번째 합성곱, 배치 정규화, ReLU를 통해 입력 특징 맵을 예약하는 RM 연산을 제안한다.
  • 예약된 입력 특징 맵을 잔차 블록의 최종 합성곱 출력과 병합함으로써, 스킵 연결을 효과적으로 제거한다.
  • 각 ResBlock에 RM 연산을 적용하여 다중 브랜치 잔차 구조를 단일 브랜치, VGG 유사 아키텍처로 변환한다.
  • 예약 및 병합 과정에서의 파라미터 및 FLOP 오버헤드를 최소화하기 위해 그룹별 및 포인트 와이즈 합성곱을 적용한다.
  • 초기 스템을 두 개의 3×3 합성곱, 배치 정규화, ReLU 스택으로 교체하고, 동일한 헤드 및 블록 구조를 유지함으로써 RMNet를 설계한다.
  • 너비 승수와 그룹 채널 설정(예: RMNet 50×6_32)을 사용하여 모델 용량과 효율성을 제어한다.

실험 결과

연구 질문

  • RQ1ResNet과 같은 깊은 네트워크에서 원래 모델의 출력을 변경하지 않고도 잔차 연결을 제거할 수 있는가?
  • RQ2RepVGG와 같은 재패러미터라이제이션 기법이 깊은 네트워크로의 확장에 효과적으로 작동하지 않는 이유는 무엇인가?
  • RQ3단일 브랜치, 단순 네트워크 아키텍처가 ResNet 및 RepVGG를 넘어서 더 나은 정확도-속도 트레이드오프를 달성할 수 있는가?
  • RQ4잔차 연결을 제거하면 고비율 네트워크 프루닝과의 호환성이 향상되는가?
  • RQ5RM 연산은 MobileNetV2와 같은 다른 아키텍처로 일반화될 수 있는가?

주요 결과

  • RMNet 50×6_32는 ImageNet에서 79.57%의 Top-1 정확도를 기록하며, 유사한 추론 속도로 ResNet-101(77.21%)과 RepVGG B2(78.78%)를 능가한다.
  • RMNet 101×6_16는 ImageNet에서 80.07%의 Top-1 정확도를 달성하여, 아키텍처 트릭 없이도 80%를 초과한 최초의 단순 모델이다.
  • RMNet 152×6_32는 ImageNet에서 80.36%의 Top-1 정확도를 기록하여, RM 연산을 통해 더 깊은 단순 네트워크도 여전히 효과적임을 입증한다.
  • RMNet 26×3_32는 오직 8.8M 파라미터와 0.51 GFLOPs로 CIFAR-10에서 95.81%의 정확도를 기록하며, 정확도와 속도 양면에서 RepVGG A2를 능가한다.
  • RM 연산은 포인트 와이즈 합성곱에서 오직 1/T의 추가 파라미터와 FLOPs만 증가시키며, 그룹별 합성곱과 함께 파라미터 효율적이다.
  • 잔차 연결이 없기 때문에 RMNet는 프루닝에 매우 적합하여 정확도 저하 없이 고비율 압축이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.