Skip to main content
QUICK REVIEW

[논문 리뷰] Edge Intelligence: On-Demand Deep Learning Model Co-Inference with Device-Edge Synergy

En Li, Zhi Zhou|arXiv (Cornell University)|2018. 06. 20.
Age of Information Optimization참고 문헌 9인용 수 52
한 줄 요약

Edgent는 모바일 기기와 에지 서버 간의 DNN 파티셔닝을 공동으로 최적화하고 조기 종료로 DNN right-sizing을 수행하는 동시 추론 프레임워크를 제안하여 지연 기한을 충족하면서 정확도를 최대화합니다.

ABSTRACT

As the backbone technology of machine learning, deep neural networks (DNNs) have have quickly ascended to the spotlight. Running DNNs on resource-constrained mobile devices is, however, by no means trivial, since it incurs high performance and energy overhead. While offloading DNNs to the cloud for execution suffers unpredictable performance, due to the uncontrolled long wide-area network latency. To address these challenges, in this paper, we propose Edgent, a collaborative and on-demand DNN co-inference framework with device-edge synergy. Edgent pursues two design knobs: (1) DNN partitioning that adaptively partitions DNN computation between device and edge, in order to leverage hybrid computation resources in proximity for real-time DNN inference. (2) DNN right-sizing that accelerates DNN inference through early-exit at a proper intermediate DNN layer to further reduce the computation latency. The prototype implementation and extensive evaluations based on Raspberry Pi demonstrate Edgent's effectiveness in enabling on-demand low-latency edge intelligence.

연구 동기 및 목표

  • 제약이 있는 기기 및 네트워크 환경에서도 모바일 애플리케이션용 저지연 DNN 추론의 필요성을 제시한다.
  • DNN 실행을 위한 기기-에지 시너지를 활용하는 공동 추론 프레임워크를 제안한다.
  • 정해진 지연 기한을 달성하기 위한 적응형 DNN 파티셔닝과 조기 종료로 정의된 right-sizing을 도입한다.
  • 레이어당 지연 시간을 예측하고 파티션 지점/종료 지점을 최적화하는 오프라인-온라인 워크플로를 제공한다.
  • Raspberry Pi 기반 프로토타입과 경험적 평가를 통해 실행 가능성을 입증한다.

제안 방법

  • 파티셔닝: 대역폭 제약 하에서 기기와 에지 간에 DNN 연산을 적응적으로 분할하여 지연 시간을 최소화한다.
  • Right-sizing: DNN에 조기 종료를 가능하게 하여 연산량을 줄이고 지연-정확도 트레이드오프를 가능하게 한다.
  • Offline profiling: 디바이스와 에지에서 레이어별 지연 시간을 예측하는 회귀 기반 모델을 구축하고 여러 종료 지점을 갖는 브랜치형 네트워크를 학습시킨다.
  • Online optimization: 대역폭 및 지연 입력을 사용하여 지연 기한을 만족하면서 정확도를 최대화하도록 종료 지점과 파티션 지점을 공동으로 최적화한다.
  • Co-inference: 선택된 계획에 따라 미리 파티션된 계층은 에지에서, 나머지 계층은 디바이스에서 실행한다.

실험 결과

연구 질문

  • RQ1가변 대역폭 하에서 기기와 에지 간의 DNN 파티셔닝이 엔드-투-엔드 지연을 어떻게 줄일 수 있는가?
  • RQ2조기 종료를 통한 DNN right-sizing이 지연 시간을 개선하면서 정해진 기한 내 정확도를 유지할 수 있는가?
  • RQ3주어진 지연 제약 조건에서 정확도를 최대화하기 위한 최적의 파티션 지점과 종료 지점 조합은 무엇인가?
  • RQ4다양한 계층 타입에서 온라인 최적화를 안내하는 회귀 기반 지연 예측기의 효과는 어느 정도인가?
  • RQ5제안된 오프라인-온라인 Edgent 워크플로우가 실시간 에지 인텔리전스를 위한 상용 하드웨어에서 실행 가능한가?

주요 결과

  • 장치 전용 실행이나 에지 전용 실행과 비교하여 파티션 및 종료 지점을 공동 최적화하면 지연을 줄일 수 있다.
  • 회귀 기반의 레이어당 지연 모델은 빠른 온라인 최적화를 가능하게 한다(실험에서 ≤1 ms).
  • 더 높은 대역폭은 더 높은 정확도의 종료 모델을 선택하게 해 지연 제약 내 엔드-투-엔드 정확도를 향상시킨다.
  • 대역폭이 증가하거나 지연 요구가 완화될수록 최적의 exit 지점이 일반적으로 증가한다.
  • 프로토타입 실험은 Edgent가 엄격한 지연 목표를 달성하고 다양한 대역폭에서 베이스라인 접근법을 능가할 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.