Skip to main content
QUICK REVIEW

[논문 리뷰] Fluid Batching: Exit-Aware Preemptive Serving of Early-Exit Neural Networks on Edge NPUs

Alexandros Kouris, Stylianos I. Venieris|arXiv (Cornell University)|2022. 09. 27.
Age of Information Optimization인용 수 6
한 줄 요약

이 논문은 엣지 NPU를 위한 하드웨are-소프트웨어 공동 설계 프레임워크인 Fluid Batching를 제안한다. 이는 초기 종료 신경망의 종료 인식형, 사전 예약형 배치 처리를 가능하게 하며, 동적으로 배치 전략을 조정하고 스택형 처리 요소를 사용함으로써 평균 지연 시간을 1.97배 감소시키고 SLO 만족도를 6.7배 향상시킨다. 이는 변동성이 크고 피크가 심한 워크로드 조건에서도 성능을 유지한다.

ABSTRACT

With deep neural networks (DNNs) emerging as the backbone in a multitude of computer vision tasks, their adoption in real-world applications broadens continuously. Given the abundance and omnipresence of smart devices in the consumer landscape, "smart ecosystems'' are being formed where sensing happens concurrently rather than standalone. This is shifting the on-device inference paradigm towards deploying centralised neural processing units (NPUs) at the edge, where multiple devices (e.g. in smart homes or autonomous vehicles) can stream their data for processing with dynamic rates. While this provides enhanced potential for input batching, naive solutions can lead to subpar performance and quality of experience, especially under spiking loads. At the same time, the deployment of dynamic DNNs, comprising stochastic computation graphs (e.g. early-exit (EE) models), introduces a new dimension of dynamic behaviour in such systems. In this work, we propose a novel early-exit-aware scheduling algorithm that allows sample preemption at run time, to account for the dynamicity introduced both by the arrival and early-exiting processes. At the same time, we introduce two novel dimensions to the design space of the NPU hardware architecture, namely Fluid Batching and Stackable Processing Elements, that enable run-time adaptability to different batch sizes and significantly improve the NPU utilisation even at small batches. Our evaluation shows that the proposed system achieves an average 1.97x and 6.7x improvement over state-of-the-art DNN streaming systems in terms of average latency and tail latency service-level objective (SLO) satisfaction, respectively.

연구 동기 및 목표

  • 엣지 기반의 다중 디바이스 추론 워크로드에서 엄격한 지연 제약을 충족하면서도 NPU의 고활용도를 유지하는 문제를 해결한다.
  • 깊은 층에서 하드웨어 활용도를 떨어뜨리는 초기 종료로 인한 동적 배치 크기 변화로 인한 성능 저하를 극복한다.
  • 다양한 요청률과 모델 동적 특성에 대응해 런타임에서의 효율적이고 적응형 배치 처리 및 사전 예약을 지원하는 시스템을 설계한다.
  • Fluid Batching와 스택형 PE와 같은 새로운 하드웨어 원리를 소프트웨어 스케줄링 알고리즘과 공동 설계하여 스트리밍 추론에서 엣지 NPU의 효율성을 향상시킨다.

제안 방법

  • Fluid Batching 도입: 실시간 배치 크기와 층 특성에 따라 각 층별로 동적으로 배치 전략을 조정하는 하드웨어 수준의 메커니즘을 제안하여 다양한 배치 크기에서 높은 성능을 달성한다.
  • 종료 및 마감 시간을 고려한 사전 예약 스케줄러 설계: 중간 종료 지점에서 런타임에서의 추론을 취소할 수 있도록 하여 초기 종료 샘플을 재배치함으로써 하드웨어 활용도를 유지한다.
  • 스택형 처리 요소(PEs) 제안: 런타임 재구성 가능한 PEs로 각 층의 입력 텐서 크기에 맞춰 차원을 조정하여 소규모 배치 크기에서의 활용도를 향상시킨다.
  • 스케줄러에 정확한 지연 시간 추정 기능을 통합하여 잘 분산된 사전 예약을 가능하게 하여 오버헤드와 SLO 위반을 최소화한다.
  • 소프트웨어 스케줄러와 하드웨어 원리를 공동 설계하여 동적 실시간 엣지 워크로드에서 종단 간 적응성과 저지연 반응을 보장한다.
  • ZC706 및 ZCU104 FPGA 플랫폼에서 ResNet-50 및 Inception-v3 백본을 사용하여 초기 종료 기능을 탑재한 DNN을 대상으로 다양한 요청률과 SLO 제약 조건 하에서 프레임워크를 평가한다.

실험 결과

연구 질문

  • RQ1초기 종료로 인한 동적 배치 크기 변화에 대응해 지연 시간이나 하드웨어 활용도를 희생시키지 않고 배치 처리를 어떻게 적응형으로 구현할 수 있는가?
  • RQ2실시간으로 중간 종료 지점에서 샘플의 효율적 사전 예약 및 재배치를 가능하게 하기 위해 필요한 하드웨어 및 스케줄링 메커니즘은 무엇인가?
  • RQ3Fluid Batching와 스택형 PEs는 다양한 배치 크기와 워크로드에서 NPU 활용도와 지연 시간 성능을 얼마나 향상시킬 수 있는가?
  • RQ4사전 예약형, 종료 인식 스케줄러는 비사전 예약 또는 정적 배치 처리 방식에 비해 지연 시간이 엄격한 엣지 추론 시스템에서 SLO 위반을 얼마나 줄일 수 있는가?
  • RQ5제안된 기법들은 혼합형 컨볼루션 및 어텐션 구성 요소를 포함한 다양한 DNN 아키텍처에서 어떻게 확장 가능한가?

주요 결과

  • Fluid Batching는 동일한 워크로드 조건에서 최신 기술 대비 평균 1.97배 높은 처리량과 6.7배 높은 SLO 만족도를 달성한다.
  • SLO를 합리적인 기준으로 설정했을 경우, 모든 테스트 구성에서 SLO 위반이 발생하지 않았으며, 기준 방법인 AdaptB는 느슨한 SLO 조건에서도 심각한 위반을 겪었다.
  • ZC706 플랫폼에서 배치 크기가 3를 초과할 경우 Fluid Batching는 ResNet-50에서 최고 성능에 가까운 성능을 확보하며, 모든 정적 배치 전략보다 뛰어난 성능을 보였다.
  • 스택형 PEs는 소규모 배치 크기(예: B=1 포함)에서 뚜렷한 성능 향상을 제공했으며, Fluid Batching와 스택형 PEs의 조합이 모든 배치 크기에서 뛰어난 활용도를 달성했다.
  • 종료 인식 사전 예약 스케줄러는 초기 종료 샘플의 효율적 재배치를 가능하게 하여 동적 배치 크기 감소로 인한 깊은 네트워크 하위 네트워크의 하드웨어 활용도 저하를 줄였다.
  • 피크가 심한 요청 도착 조건에서도 높은 성능과 낮은 지연 시간을 유지하여 실제 엣지 배포 환경에서의 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.