Skip to main content
QUICK REVIEW

[논문 리뷰] Layer Pruning via Fusible Residual Convolutional Block for Deep Neural Networks

Pengtao Xu, Jian Cao|arXiv (Cornell University)|2020. 11. 29.
Advanced Neural Network Applications참고 문헌 31인용 수 14
한 줄 요약

이 논문은 훈련 중에 전체 네트워크 레이어를 자동으로 구조적으로 제거할 수 있도록 허용하는 새로운 레이어 프루닝 방법을 제안한다. L1 정규화를 적용한 학습 가능한 스케일링 인자와 함께 잔차 합성 컨볼루션 블록(ResConv)을 도입함으로써, 중요도가 낮은 레이어를 식별하고 제거한다. 이로 인해 정확도 손실가 최소화되면서도 높은 압축률과 속도 향상을 달성한다. 예를 들어, CIFAR-10에서 ResNet-110에 대해 65.5%의 FLOPs 감소와 55.5%의 파라미터 감소를 기록했으며, 상위-1 정확도 손실은 단 0.13%에 그친다.

ABSTRACT

In order to deploy deep convolutional neural networks (CNNs) on resource-limited devices, many model pruning methods for filters and weights have been developed, while only a few to layer pruning. However, compared with filter pruning and weight pruning, the compact model obtained by layer pruning has less inference time and run-time memory usage when the same FLOPs and number of parameters are pruned because of less data moving in memory. In this paper, we propose a simple layer pruning method using fusible residual convolutional block (ResConv), which is implemented by inserting shortcut connection with a trainable information control parameter into a single convolutional layer. Using ResConv structures in training can improve network accuracy and train deep plain networks, and adds no additional computation during inference process because ResConv is fused to be an ordinary convolutional layer after training. For layer pruning, we convert convolutional layers of network into ResConv with a layer scaling factor. In the training process, the L1 regularization is adopted to make the scaling factors sparse, so that unimportant layers are automatically identified and then removed, resulting in a model of layer reduction. Our pruning method achieves excellent performance of compression and acceleration over the state-of-the-arts on different datasets, and needs no retraining in the case of low pruning rate. For example, with ResNet-110, we achieve a 65.5%-FLOPs reduction by removing 55.5% of the parameters, with only a small loss of 0.13% in top-1 accuracy on CIFAR-10.

연구 동기 및 목표

  • 추론 효율성과 메모리 사용량 측면에서의 이점에도 불구하고, 효과적인 레이어 프루닝 방법의 부족을 해결한다.
  • 훈련 중에 전체 컨볼루션 레이어를 구조적으로 자동으로 제거할 수 있는 방법을 개발한다.
  • 자원이 제한된 장치에서 높은 모델 압축률과 속도 향상을 달성하면서 정확도 저하를 최소화한다.
  • 훈련 후에 ResConv 구조를 표준 컨볼루션으로 융합함으로써 추론 시에 추가적인 계산 오버헤드 없이 효율성을 확보한다.
  • 낮은 프루닝 비율에서 프루닝 후 재훈련이 필요 없이 최신 기술 수준의 성능을 달성한다.

제안 방법

  • 단일 컨볼루션 레이어에 학습 가능한 스케일링 인자와 쇼트컷 연결을 삽입하는 융합 가능한 잔차 합성 컨볼루션 블록(ResConv)을 도입한다.
  • 각 컨볼루션 레이어의 기여도를 제어하기 위해 레이어 스케일링 인자를 사용하여 희박성 기반의 구조적 프루닝을 가능하게 한다.
  • 훈련 중에 스케일링 인자에 L1 정규화를 적용하여 희박성을 유도하고 중요도가 낮은 레이어를 식별한다.
  • ResConv 블록을 사용하여 정확도를 유지하면서 깊은 평탄한 네트워크의 훈련을 가능하게 한다.
  • 훈련 후에 스케일링 인자를 흡수하여 ResConv 구조를 표준 컨볼루션 레이어로 융합함으로써 추론 오버헤드를 제거한다.
  • 스케일링 인자가 0 또는 근처의 값인 레이어를 제거하여 전체 레이어를 프루닝함으로써, 컴act하고 효율적인 모델을 얻는다.

실험 결과

연구 질문

  • RQ1잔차 블록 구조 내에서 학습 가능한 스케일링 인자가 정확도를 저하시키지 않으면서도 자동으로 구조적 레이어 프루닝을 가능하게 할 수 있는가?
  • RQ2이러한 방법이 이미지 분류 벤치마크에서 FLOPs와 파라미터를 줄이면서도 높은 정확도를 유지하는 데 얼마나 효과적인가?
  • RQ3특히 낮은 프루닝 비율에서 높은 압축률과 가속도를 달성하면서 정확도 손실가 최소화되는가?
  • RQ4융합된 ResConv 구조가 추론 시에 추가적인 계산 비용 없이 원활하게 통합될 수 있는가?
  • RQ5기존의 필터 및 가중치 프루닝 기법과 비교해 볼 때, 이 방법은 추론 효율성과 모델의 컴act성 측면에서 어떻게 성능을 내는가?

주요 결과

  • 제안된 방법은 CIFAR-10에서 ResNet-110에 대해 상위-1 정확도 손실이 단 0.13%에 그치는 동안 FLOPs를 65.5% 감소시키고 파라미터를 55.5% 감소시켰다.
  • 낮은 프루닝 비율에서도 재훈련 없이도 높은 압축률과 가속도를 달성할 수 있다.
  • 훈련 후 융합된 ResConv 구조는 추론 시에 추가적인 계산 오버헤드 없이 통합되므로, 계산 비용이 발생하지 않는다.
  • 스케일링 인자에 대한 L1 정규화가 성공적으로 희박성을 유도하여 중요도가 낮은 레이어를 자동으로 식별하고 제거할 수 있었다.
  • 데이터 이동 최소화 덕분에 기존의 최신 기술 수준의 프루닝 기법보다 추론 효율성과 메모리 사용 측면에서 뛰어난 성능을 보였다.
  • 채널 수준 및 레이어 수준의 구조적 프루닝을 가능하게 하면서도 고정확도를 유지함으로써, 자원이 제한된 장치에의 배포에 적합한 솔루션이 되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.