Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Device-Edge Cooperative Inference of Deep Learning via 2-Step Pruning

Wenqi Shi, Yunzhong Hou|arXiv (Cornell University)|2019. 03. 08.
IoT and Edge/Fog Computing참고 문헌 13인용 수 13
한 줄 요약

이 논문은 이동형 DNN 추론에서 종단 간 지연을 줄이기 위해 모델 압축과 디바이스-에지 계산 분할을 동시에 최적화하는 2단계 프루닝 프레임워크를 제안한다. 첫 번째 단계에서는 계산 감소를 위해, 두 번째 단계에서는 전송 감소를 위해 반복적으로 중요하지 않은 필터를 프루닝한 후, 선택적 손실 없는 PNG 인코딩을 적용함으로써, 비프루닝 분할 대비 전송 작업량을 최대 25.6배 감소시키고, 총 계산 속도를 6.01배 빠르게 하며, 종단 간 지연을 4.81배 낮추는 데 성공한다. 특히 WiFi 환경에서 뚜렷한 성능 향상을 보인다.

ABSTRACT

Deep neural networks (DNNs) are state-of-the-art solutions for many machine learning applications, and have been widely used on mobile devices. Running DNNs on resource-constrained mobile devices often requires the help from edge servers via computation offloading. However, offloading through a bandwidth-limited wireless link is non-trivial due to the tight interplay between the computation resources on mobile devices and wireless resources. Existing studies have focused on cooperative inference where DNN models are partitioned at different neural network layers, and the two parts are executed at the mobile device and the edge server, respectively. Since the output data size of a DNN layer can be larger than that of the raw data, offloading intermediate data between layers can suffer from high transmission latency under limited wireless bandwidth. In this paper, we propose an efficient and flexible 2-step pruning framework for DNN partition between mobile devices and edge servers. In our framework, the DNN model only needs to be pruned once in the training phase where unimportant convolutional filters are removed iteratively. By limiting the pruning region, our framework can greatly reduce either the wireless transmission workload of the device or the total computation workload. A series of pruned models are generated in the training phase, from which the framework can automatically select to satisfy varying latency and accuracy requirements. Furthermore, coding for the intermediate data is added to provide extra transmission workload reduction. Our experiments show that the proposed framework can achieve up to 25.6$ imes$ reduction on transmission workload, 6.01$ imes$ acceleration on total computation and 4.81$ imes$ reduction on end-to-end latency as compared to partitioning the original DNN model without pruning.

연구 동기 및 목표

  • 중간 특징 맵이 원본 데이터 크기를 초과할 때 특히, 디바이스-에지 협동 DNN 추론에서 높은 전송 지연과 계산 불균형 문제를 해결하기 위해.
  • 대역폭과 지연 제약 조건 하에서 이동형 DNN 추론의 종단 간 지연과 에너지 소비를 줄이기 위해.
  • 시스템 조건(예: 채널 품질, 지연, 정확도 요구사항)에 따라 유연하고 자동으로 프루닝 비율과 분할 지점을 선택할 수 있도록 하기 위해.
  • 특징 인코딩과 조기 종료 기법과 같은 기존 방법을 향상시키기 위해, 프루닝과 압축을 조합하여 더 나은 정확도-지연 트레이드오���을 달성하기 위해.
  • 정확도 손실 없이 전송 오버헤드를 추가로 줄일 수 있도록 손실 없는 인코딩(예: PNG)과 호환되는 프레임워크를 제공하기 위해.

제안 방법

  • 프레임워크는 두 단계의 반복적 채널 프루닝을 수행한다: 단계 1은 총 계산 작업량 감소를 위해 필터를 프루닝하고, 단계 2는 전송을 위한 중간 특징 맵 크기 최소화를 위해 추가 프루닝을 수행한다.
  • 프루닝은 각 레이어 내에서 선택적으로 적용되며, 정확도 손실이 크지 않게 하면서도 불필요한 채널을 줄여 데이터 볼륨을 최소화한다.
  • 학습 중에 다양한 압축 비율을 가진 프루닝된 모델의 시리즈가 생성되어, 런타임에서 시스템 제약 조건에 따라 선택 가능하다.
  • 프레임워크는 최적의 분할 지점을 자동으로 선택할 수 있으며, 최대 풀링 레이어에서 이뤄지며, 이는 4배 공간 축소와 낮은 계산 비용으로 인해 이상적이다.
  • 분할 지점에서 중간 특징에 대해 손실 없는 PNG 인코딩을 적용하여 추가로 데이터를 압축하며, 프루닝으로 인해 재현성의 증가가 이루어질수록 수익 감소 효과가 나타난다.
  • 이 방법은 VGG 모델을 대상으로 평가되었으며, 비프루닝 기반 기준 분할 및 이전의 특징 인코딩 기법(예: JPEG 기반)과 비교되었다.

실험 결과

연구 질문

  • RQ12단계 프루닝 전략이 디바이스-에지 DNN 추론에서 계산과 전송 작업량을 효과적으로 줄일 수 있는가?
  • RQ2프루닝과 손실 없는 인코딩(예: PNG)의 조합이 정확도를 유지하면서 전송 효율을 어떻게 향상시키는가?
  • RQ3다양한 무선 환경 조건 하에서 종단 간 지연을 최소화하기 위한 최적의 분할 지점은 무엇인가?
  • RQ4기존의 특징 인코딩 기법과 비교할 때 2단계 프루닝 프레임워크는 정확도와 지연 측면에서 어떻게 성능을 냈는가?
  • RQ5프레임워크는 3G, 4G, WiFi 등 다양한 시스템 제약 조건에 얼마나 잘 적응할 수 있으며, 높은 정확도를 유지할 수 있는가?

주요 결과

  • 2단계 프루닝 프레임워크는 비프루닝 DNN 분할 대비 전송 작업량을 최대 25.6배 감소시킨다.
  • 두 단계 모두 효과적인 필터 프루닝 덕분에 총 계산 작업량이 6.01배 빨라진다.
  • WiFi 환경에서는 종단 간 지연이 최대 4.81배 감소하였으며, 4G와 3G 네트워크에서는 각각 3.69배와 2.61배 향상되었다.
  • 높은 압축 비율에서도 정확도 손실이 4% 이내로 유지되어, JPEG 기반 특징 인코딩과 같은 손실 기반 방법보다 뛰어난 성능을 보였다.
  • PNG 인코딩은 정확도 손실 없이 중간 특징에 대해 추가로 약 2배의 압축을 제공하며, 특히 프루닝 수준이 중간일 경우에 효과적이다.
  • 백엔드의 최대 풀링 레이어(예: Max Pool 3–5)는 프루닝에 대한 민감도가 낮고 압축 잠재력이 높아 가장 유리한 분할 지점이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.