[논문 리뷰] Dynamic Runtime Feature Map Pruning
이 논문은 추론 중 활성화되지 않은 특징 맵을 제거함으로써 합성곱 신경망에서 대역폭 사용을 줄이기 위해 런타임 동안 특징 맵을 동적으로 정리하는 방법을 제안한다. 값이 ε 이내로 거의 0에 가까운 특징 맵을 식별하고 건너뛰어, 정확도 손실 없이 특징 맵 로딩을 10% 줄였으며, 추가로 5%를 줄일 수 있었고 이는 정확도가 1% 떨어지는 데에 그쳤다. 이는 재학습이 필요 없고 비정규적인 네트워크 구조를 유발하지 않는 정적 가중치 정리와 보완된다.
High bandwidth requirements are an obstacle for accelerating the training and inference of deep neural networks. Most previous research focuses on reducing the size of kernel maps for inference. We analyze parameter sparsity of six popular convolutional neural networks - AlexNet, MobileNet, ResNet-50, SqueezeNet, TinyNet, and VGG16. Of the networks considered, those using ReLU (AlexNet, SqueezeNet, VGG16) contain a high percentage of 0-valued parameters and can be statically pruned. Networks with Non-ReLU activation functions in some cases may not contain any 0-valued parameters (ResNet-50, TinyNet). We also investigate runtime feature map usage and find that input feature maps comprise the majority of bandwidth requirements when depth-wise convolution and point-wise convolutions used. We introduce dynamic runtime pruning of feature maps and show that 10% of dynamic feature map execution can be removed without loss of accuracy. We then extend dynamic pruning to allow for values within an epsilon of zero and show a further 5% reduction of feature map loading with a 1% loss of accuracy in top-1.
연구 동기 및 목표
- 깊은 신경망 추론의 높은 대역폭 요구를 해결하기 위해, 특히 깊이 분할형 및 포인트 와이즈 컨볼루션에서 입력 특징 맵으로 인한 대역폭을 줄이기 위해.
- 정적 정리에서 흔히 볼 수 있는 재학습이 필요하거나 비정규적인 네트워크 아키텍처를 피하면서, 런타임에서 특징 맵을 동적으로 정리하는 방법을 탐색하기 위해.
- 정확도 손실이 크지 않은 수준에서, 값이 0 또는 ε 이내로 거의 0인 특징 맵을 정리하여 메모리 대역폭을 줄일 수 있는지 평가하기 위해.
- 정적 가중치 정리와의 비교를 통해 현대의 CNN에서 이 둘의 보완적 이점을 평가하기 위해.
제안 방법
- 이 방법은 추론 도중 값이 임계치 ε 이하인 특징 맵을 동적으로 식별하고 건너뛰어 데이터 로딩과 대역폭 사용을 줄인다.
- 깊이 분할형 및 포인트 와이즈 컨볼루션에서 특징 맵이 주로 대역폭 병목 현상이 되며, 특히 현대 아키텍처에서 그러한 경향이 뚜렷하다는 관찰을 활용한다.
- 재학습이 필요 없고, 사전 학습된 모델에 적용되며, 처리 전에 특징 맵 값 확인을 통해 런타임에서 작동한다.
- 표준 정리 기법을 확장하여, 0에 가까운 값(ε 이내)도 정리할 수 있도록 허용함으로써, 정확도 손실을 최소한도로 줄이며 추가로 대역폭 절감을 이룬다.
- 이 기법은 다양한 활성화 함수와 스퍼시티 수준에서 다양한 네트워크—AlexNet, MobileNet, ResNet-50, SqueezeNet, TinyNet, VGG16—에서 평가되었다.
- 정적 가중치 정리와 보완적이다. 왜냐하면 가중치 압축 후에도 특징 맵 대역폭이 여전히 주요 병목 현상이기 때문이며, 특히 깊이 분할형 컨볼루션을 사용하는 현대 CNN에서 그러하다.
실험 결과
연구 질문
- RQ1동적 특징 맵 정리가 정확도 손실 없이 DNN 추론의 대역폭 사용을 줄일 수 있는가?
- RQ2특징 맵의 스퍼시티는 ReLU와 비-ReLU 활성화 함수를 사용하는 다양한 CNN 아키텍처에서 어떻게 달라지는가?
- RQ30에 가까운 값(ε 이내)을 가지는 특징 맵을 정리함으로써 대역폭 효율성을 얼마나 향상시킬 수 있으며, 정확도를 유지할 수 있는가?
- RQ4정적 가중치 정리와 비교했을 때 동적 특징 맵 정리는 얼마나 효과적인가? 둘을 함께 사용할 수 있는가?
주요 결과
- 여러 네트워크, 특히 ReLU 활성화 함수를 사용하는 네트워크에서 동적 특징 맵 실행의 10%를 제거해도 상위 1위 정확도에 아무런 손실 없이 유지된다.
- 0에 가까운 값(ε 이내)을 가지는 특징 맵을 정리함으로써 추가로 5%의 특징 맵 로딩을 줄일 수 있었고, 이는 정확도가 1% 떨어지는 데에 그쳤다.
- ReLU를 사용하는 네트워크(예: AlexNet, SqueezeNet, VGG16)는 높은 매개변수 스퍼시티(50% 이상)를 보이며 정적 정리에 효과적이나, 비-ReLU 네트워크(예: ResNet-50, TinyNet)는 거의 0인 매개변수 값이 거의 없음을 보였다.
- 낮은 매개변수 스퍼시티를 보이는 네트워크에서도 런타임에서 특징 맵 값의 스퍼시티 덕분에 동적 특징 맵 정리가 여전히 효과적이며, 특히 깊이 분할형 및 포인트 와이즈 컨볼루션 레이어에서 두드러진다.
- 정적 가중치 정리와 보완적이다. 왜냐하면 가중치 압축 후에도 특징 맵 대역폭이 여전히 주요 병목 현상이며, 특히 깊이 분할형 컨볼루션을 사용하는 현대 CNN에서 그러하다.
- 재학습 없이도 상당한 대역폭 절감을 이룰 수 있어 자원 제약이 있는 환경에서의 구현에 적합하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.