[논문 리뷰] JointDNN: An Efficient Training and Inference Engine for Intelligent Mobile Cloud Computing Services
JointDNN는 깊이 신경망(DNN) 추론과 훈련을 레이어 수준에서 모바일 및 클라우드 플랫폼 간에 런타임에서 적응형으로 분할하는 런타임 기반의 적응형 프레임워크를 제안한다. 이는 지연 시간과 에너지 소비를 최소화하기 위한 것이다. DNN 계산을 방향성 있는 비순환 그래프(DAG)에서의 최단경로 문제로 모델링하고, 배터리, 클라우드 부하, QoS 제약 조건을 고려하여 혼합정수선형계획법(MILP)을 사용해 최적화함으로써, 클라우드 전용 또는 모바일 전용 접근 방식에 비해 모바일 에너지 소비를 최대 32배 감소시키고 지연 시간을 18배 감소시킨다.
Deep learning models are being deployed in many mobile intelligent applications. End-side services, such as intelligent personal assistants, autonomous cars, and smart home services often employ either simple local models on the mobile or complex remote models on the cloud. However, recent studies have shown that partitioning the DNN computations between the mobile and cloud can increase the latency and energy efficiencies. In this paper, we propose an efficient, adaptive, and practical engine, JointDNN, for collaborative computation between a mobile device and cloud for DNNs in both inference and training phase. JointDNN not only provides an energy and performance efficient method of querying DNNs for the mobile side but also benefits the cloud server by reducing the amount of its workload and communications compared to the cloud-only approach. Given the DNN architecture, we investigate the efficiency of processing some layers on the mobile device and some layers on the cloud server. We provide optimization formulations at layer granularity for forward- and backward-propagations in DNNs, which can adapt to mobile battery limitations and cloud server load constraints and quality of service. JointDNN achieves up to 18 and 32 times reductions on the latency and mobile energy consumption of querying DNNs compared to the status-quo approaches, respectively.
연구 동기 및 목표
- 모바일 전용 또는 클라우드 전용 DNN 추론과 훈련 방식이 높은 지연 시간, 높은 에너지 소비 또는 통신 오버헤드로 인해 비효율적인 데에 대비하기 위해.
- 실시간 제약 조건(배터리 수준, 네트워크 상태, 클라우드 서버 부하)을 기반으로 모바일과 클라우드 간 DNN 레이어의 계산 분할을 런타임에서 적응형으로 가능하게 하기 위해.
- PNG 기반 타일링과 압축을 통해 중간 레이어 출력을 압축하여 모바일과 클라우드 양측의 통신 비용과 부하를 줄이기 위해.
- 기존 도구인 Neurosurgeon의 제한을 초월해 CNN, RNN, 오토인코더를 포함한 다양한 DNN 아키텍처를 지원하기 위해.
- 혼합정수선형계획법(MILP)을 사용하여 지연 시간, 에너지 소비, 서비스 품질(QoS)을 균형 잡는 통합 최적화 프레임워크를 제공하기 위해.
제안 방법
- JointDNN는 각 노드가 레이어를 나타내고 간선이 데이터 흐름을 나타내는 방향성 있는 비순환 그래프(DAG)로 DNN를 모델링하여, 모바일과 클라우드 간 레이어 수준의 계산 분할을 가능하게 한다.
- 최적의 분할 문제를 DAG 내 최단경로 문제로 공식화하며, 모바일 배터리, 클라우드 혼잡도, QoS 제약 조건을 포함하여 NP-완전 문제로 간주되며, 이를 MILP로 해결할 수 있다.
- 이 프레임워크는 ResNet과 RNN과 같은 복잡한 아키텍처를 다룰 수 있는 그래프 기반 접근 방식을 사용하여, 단일 스위치 모델을 초월해 다중 홉 실행 패턴(예: 모바일-클라우드-모바일)을 지원한다.
- 중간 레이어 출력은 여러 개의 특징맵 채널을 수평으로 인접 배치하여 2차원 행렬로 정렬함으로써 압축 효율을 향상시키는 PNG 기반 타일링 방식으로 압축된다.
- 압축 비율(CR)은 원본 레이어 크기(8비트)를 압축된 PNG 크기로 나눈 비율로 계산되며, AlexNet과 VGG16에 대해 각각 최대 5.8배와 3.5배의 평균 향상을 달성한다.
- MILP 공식화는 압축 비용과 통신 오버헤드를 통합하여 추론 및 훈련 단계 모두에서 지연 시간과 에너지 소비를 종합적으로 최적화할 수 있도록 한다.
실험 결과
연구 질문
- RQ1모바일와 클라우드 간 동적이고 레이어 수준의 DNN 추론 분할이 고정된 모바일 전용 또는 클라우드 전용 전략에 비해 지연 시간과 에너지 소비를 줄일 수 있는가?
- RQ2중간 레이어 압축의 포함 여부가 모바일-클라우드 DNN 실행에서 통신 비용과 전체 시스템 효율성에 어떤 영향을 미치는가?
- RQ3CNN, RNN, 오토인코더와 같은 다양한 DNN 아키텍처에 적합한 최적의 실행 패턴(예: 모바일-클라우드, 클라우드-모바일, 또는 다중 홉)은 무엇인가?
- RQ4실시간 제약 조건(배터리, 클라우드 부하, QoS) 하에서 MILP 기반 최적화가 다양한 DNN 워크로드에서 시스템 성능을 얼마나 향상시킬 수 있는가?
- RQ5기존 도구인 Neurosurgeon이 엄격한 실행 가정으로 인해 실패하는 복잡한 아키텍처인 ResNet과 생성 모델과 같은 경우에 JointDNN의 접근 방식은 어떻게 확장 가능한가?
주요 결과
- JointDNN는 클라우드 전용 추론에 비해 모바일 에너지 소비를 최대 32배 감소시켜 모바일 애플리케이션의 배터리 수명을 크게 연장한다.
- 기존의 클라우드 전용 접근 방식에 비해 지연 시간이 최대 18배 감소하여 실시간 서비스의 반응성을 향상시킨다.
- PNG 기반 타일링과 압축은 중간 레이어 통신을 최대 5.8배(AlexNet)와 3.5배(VGG16) 감소시키며, 압축을 최적화에 통합할 경우 에너지 효율성에 추가로 4.9배 향상된다.
- 이 프레임워크는 모바일-클라우드-모바일 및 클라우드-모바일 실행 패턴을 포함한 다양한 실행 패턴을 지원하여, 기존 도구가 단일 스위치 실행을 가정하는 것과는 달리 온라인 훈련과 생성 모델에서 흔한 패턴을 처리할 수 있다.
- MILP 기반 최적화 프레임워크는 배터리, 클라우드 부하, QoS 등의 다중 제약 조건을 성공적으로 균형 잡으며, 다양한 배포 환경에서의 적응 가능성을 입증한다.
- JointDNN는 범위와 적응 가능성 면에서 Neurosurgeon을 능가하며, RNN과 오토인코더와 같은 복잡한 아키텍처를 지원하고, 레이어 간 최적화 및 다중 지점 데이터 전송을 처리할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.