Skip to main content
QUICK REVIEW

[논문 리뷰] Auto-tuning Neural Network Quantization Framework for Collaborative Inference Between the Cloud and Edge

Guangli Li, Lei Liu|arXiv (Cornell University)|2018. 12. 16.
Advanced Neural Network Applications참고 문헌 11인용 수 4
한 줄 요약

이 논문은 클라우드-에지 공동 인퍼런스를 위한 자동 튜닝 신경망 양자화 프레임워크를 제안하며, 딥 네ural 네트워크 내에서 최적의 혼합 정밀도 파artition 포인트를 자동으로 식별한다. 초기 레이어를 모바일 에지 디바이스에서 실행하기 위해 양자화하고 후속 레이어를 클라우드로 오프로드함으로써, 이 프레임워크는 모델 저장 용량을 최대 99.97% 감소시키며 ImageNet 벤치마크에서 정확도 손실이 0.2% 미만일 때 1.7배의 속도 향상을 달성한다.

ABSTRACT

Recently, deep neural networks (DNNs) have been widely applied in mobile intelligent applications. The inference for the DNNs is usually performed in the cloud. However, it leads to a large overhead of transmitting data via wireless network. In this paper, we demonstrate the advantages of the cloud-edge collaborative inference with quantization. By analyzing the characteristics of layers in DNNs, an auto-tuning neural network quantization framework for collaborative inference is proposed. We study the effectiveness of mixed-precision collaborative inference of state-of-the-art DNNs by using ImageNet dataset. The experimental results show that our framework can generate reasonable network partitions and reduce the storage on mobile devices with trivial loss of accuracy.

연구 동기 및 목표

  • 모바일 디바이스에서 클라우드 전용 DNN 인퍼런스 시 높은 전송 오버헤드와 개인정보 위험 문제를 해결하기 위해.
  • 에지 배포를 통해 모바일 AI 애플리케이션의 모델 저장 및 통신 비용을 줄이기 위해.
  • 혼합 정밀도 양자화를 활용한 효율적이고 개인정보 보호 기능을 갖춘 공동 인퍼런스를 가능하게 하기 위해.
  • 클라우드-에지 워크로드에 최적의 네트워크 파artition 포인트를 자동으로 선택하기 위해.
  • 정확도 저하를 최소화하면서 동시에 인퍼런스 속도 향상과 저장 용량 감소를 극대화하기 위해.

제안 방법

  • 계산 및 메모리 특성에 기반해 후보 파artition 포인트를 식별하기 위해 DNN 레이어 구조를 분석한다.
  • 에지 디바이스에서의 저장 용량 및 계산량 감소를 위해 초기 네트워크 레이어에 INT8 스칼라 양자화를 적용한다.
  • 각 후보 파artition 포인트에 대해 현장에서의 프ofile링을 통해 인퍼런스 지연 시간과 통신 오버헤드를 측정한다.
  • 모든 후보 파artition 포인트를 평가하고 속도와 정확도의 상충 관계를 기반으로 최적의 포인트를 선택하기 위해 자동 튜닝 알고리즘을 활용한다.
  • 네트워크의 첫 번째 부분을 에지에서 실행(양자화된 상태)하고 나머지 부분을 클라우드에서 실행(풀 정밀도)함으로써 성능과 개인정보 보호를 균형 있게 유지한다.
  • 에지 및 클라우드 양쪽에서 인퍼런스를 가속화하기 위해 최적화된 저정밀도 라이브러리(예: gemmlowp, cuDNN)를 활용한다.

실험 결과

연구 질문

  • RQ1클라우드-에지 공동 인퍼런스 환경에서 DNN의 어떤 레이어가 파artition에 가장 적합한가?
  • RQ2혼합 정밀도 양자화를 어떻게 활용하여 모델 크기와 통신 오버헤드를 줄이되, 정확도 손실을 최소화할 수 있는가?
  • RQ3무선 환경에서 인퍼런스 속도, 저장 용량, 정확도를 균형 잡는 데 최적의 네트워크 파artition 포인트는 무엇인가?
  • RQ4자동 튜닝이 ResNet 및 VGG와 같은 최신 상태의 DNN에 대해 최적의 파artition를 효과적으로 식별할 수 있는가?
  • RQ5클라우드 전용 인퍼런스에 비해 공동 인퍼런스는 데이터 전송을 얼마나 줄이고 개인정보 보호를 얼마나 향상시킬 수 있는가?

주요 결과

  • 프레임워크는 저대역폭 환경에서 전송 오버헤드를 줄이기 위해 AlexNet의 경우 conv5를 최적의 파artition 포인트로 선택하여 1.7배의 속도 향상을 달성했다.
  • 모바일 디바이스에서의 모델 저장 용량은 AlexNet 기준 96.17%, VGG16 기준 99.97%, ResNet-18 기준 85.63%, GoogLeNet 기준 98.22% 감소했다.
  • 모든 테스트된 네트워크에서 정확도 손실이 가장 큰 경우도 -0.11%에 불과했으며, 대부분의 모델에서 정확도 저하가 극히 미미했다(≤0.1%).
  • 특히 저대역폭 무선 환경에서 전송 오버헤드가 높을 경우, 공동 인퍼런스는 클라우드 전용 인퍼런스보다 빠른 성능을 보였다.
  • 프레임워크는 각 네트워크에 대해 가장 우수하고 빠른 파artition 포인트를 성공적으로 식별하여 다양한 아키텍처에 걸쳐 뛰어난 견고성을 입증했다.
  • 중간 특징 맵은 저정밀도 형식으로 전송되어 통신 부하가 감소하고 사용자 개인정보 보호가 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.