Skip to main content
QUICK REVIEW

[논문 리뷰] Characterizing the Deep Neural Networks Inference Performance of Mobile Applications

Samuel S. Ogden, Tian Guo|arXiv (Cornell University)|2019. 09. 10.
Advanced Neural Network Applications참고 문헌 44인용 수 20
한 줄 요약

이 논문은 가변적인 네트워크 조건 하에서 정확도와 엔드 투 엔드 지연 시간을 균형 잡는 데 목적이 있는 동적 모델 선택 알고리즘인 CNNSelect를 제안한다. 이는 런타임 시에 사전 훈련된 CNN 모델들 중에서 선택함으로써 클라우드 기반 딥 뉴럴 네트워크 추론을 모바일 애플리케이션에서 최적화한다. 이 알고리즘은 탐욕적 선택 방식 대비 SLA 이행률을 88.5% 향상시키며, 특히 엄격한 지연 예산 조건에서 높은 정확도를 유지한다.

ABSTRACT

Today's mobile applications are increasingly leveraging deep neural networks to provide novel features, such as image and speech recognitions. To use a pre-trained deep neural network, mobile developers can either host it in a cloud server, referred to as cloud-based inference, or ship it with their mobile application, referred to as on-device inference. In this work, we investigate the inference performance of these two common approaches on both mobile devices and public clouds, using popular convolutional neural networks. Our measurement study suggests the need for both on-device and cloud-based inferences for supporting mobile applications. In particular, newer mobile devices is able to run mobile-optimized CNN models in reasonable time. However, for older mobile devices or to use more complex CNN models, mobile applications should opt in for cloud-based inference. We further demonstrate that variable network conditions can lead to poor cloud-based inference end-to-end time. To support efficient cloud-based inference, we propose a CNN model selection algorithm called CNNSelect that dynamically selects the most appropriate CNN model for each inference request, and adapts its selection to match different SLAs and execution time budgets that are caused by variable mobile environments. The key idea of CNNSelect is to make inference speed and accuracy trade-offs at runtime using a set of CNN models. We demonstrated that CNNSelect smoothly improves inference accuracy while maintaining SLA attainment in 88.5% more cases than a greedy baseline.

연구 동기 및 목표

  • 모바일 애플리케이션에서 온디바이스 및 클라우드 기반 딥 뉴럴 네트워크 추론 간의 성능 트레이드오���을 규명하는 것.
  • 모바일 하드웨어, 네트워크 조건, 모델 압축 기법 등 추론에 영향을 주는 주요 성능 요인을 규명하는 것.
  • 클라우드 기반 추론에서 변동하는 네트워크 조건이 엔드 투 엔드 지연 시간과 SLA 준수를 악화시키는 문제를 해결하는 것.
  • 동적인 모바일 환경에 적응할 수 있는 런타임 모델 선택 알고리즘을 설계하여 추론 정확도와 지연 시간을 균형 잡는 것.
  • 제안된 CNNSelect 알고리즘의 효과성을 평가하여 SLA 이행률 향상과 성능 효율성 향상을 도모하는 것.

제안 방법

  • 저자는 다양한 모바일 디바이스와 클라우드 서버를 대상으로 실증 측정 연구를 수행하여, Caffe, TensorFlow 등의 다양한 CNN 모델과 프레임워크에 대해 엔드 투 엔드 추론 시간과 자원 소비를 평가한다.
  • 모바일 하드웨어, 딥 러닝 프레임워크, 모델 압축, 네트워크 조건이 온디바이스 및 클라우드 기반 추론 성능에 미치는 영향을 분석한다.
  • CNNSelect는 실시간 네트워크 전송 시간과 SLA 제약 조건을 기반으로 가장 적절한 CNN 모델을 선택하는 확률적 모델 선택 전략을 사용한다.
  • 이 알고리즘은 정확도와 추론 속도 간의 트레이드오프가 다른 사전 훈련된 모바일 최적화 CNN 모델의 집합을 유지한다.
  • 변동하는 네트워크 조건에 대응하여 런타임에서 모델을 동적으로 선택함으로써 엔드 투 엔드 지연 시간을 최소화하면서 정확도와 SLA 요구 사항을 충족한다.
  • 평가에는 엔드 투 엔드 테스트와 광범위한 시뮬레이션을 포함하여 CNNSelect의 성능이 다양한 모바일 환경에서 검증된다.

실험 결과

연구 질문

  • RQ1모바일 애플리케이션에서 온디바이스 및 클라우드 기반 DNN 추론에 영향을 주는 주요 성능 요인는 무엇인가?
  • RQ2모바일 하드웨어, 네트워크 조건, 모델 압축 기법은 추론 지연 시간과 정확도에 어떻게 영향을 미치는가?
  • RQ3변동하는 네트워크 조건가 클라우드 기반 추론 성능과 SLA 준수에 얼마나 심각한 영향을 미치는가?
  • RQ4동적 모델 선택 전략은 변동하는 모바일 환경 하에서 높은 추론 정확도를 유지하면서 SLA 준수를 향상시킬 수 있는가?
  • RQ5CNNSelect는 탐욕적 모델 선택 대비 SLA 이행률 향상과 지연 시간 감소 측면에서 어떻게 비교되는가?

주요 결과

  • 최신 모바일 디바이스에서 모바일 최적화 CNN 모델을 사용할 경우 온디바이스 추론이 가능하지만, 오래된 기기나 복잡한 모델의 경우 클라우드 기반 추론이 필요하다.
  • 클라우드 추론에서의 모델 시작 지연 시간은 주로 수개월에서 수십 배의 오버헤드를 유발하며, 서버 배포 시 신중히 관리해야 한다.
  • 변동하는 모바일 네트워크 조건은 엔드 투 엔드 클라우드 추론 지연 시간에 심각한 영향을 미치며, 특히 변동성이 높을 경우 더욱 심각하다.
  • CNNSelect는 탐욕적 기반 대비 SLA 이행률을 88.5% 향상시키며, 특히 엄격한 지연 예산 조건에서 뛰어난 성능을 보인다.
  • SLA 예산이 250ms를 초과할 경우 CNNSelect는 정확도는 유사하게 유지하면서 엔드 투 엔드 지연 시간을 최대 43% 감소시킨다.
  • 알고리즘은 실시간 네트워크 및 SLA 조건에 맞춰 모델 선택을 적응시킴으로써 정확도와 지연 시간을 효과적으로 균형 잡는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.