Skip to main content
QUICK REVIEW

[논문 리뷰] PREMA: A Predictive Multi-task Scheduling Algorithm For Preemptible Neural Processing Units

Yujeong Choi, Minsoo Rhu|arXiv (Cornell University)|2019. 09. 06.
IoT and Edge/Fog Computing인용 수 4
한 줄 요약

이 논문은 경량 체크포인팅을 사용해 저우선순위 작업을 지능적으로 프리에임프션하는 예측형 다중작업 스케줄링 알고리즘 PREMA를 제안한다. 이는 선점 가능한 신경처리장치(NPU)에서 지연, 처리량, SLA 준수를 향상시킨다. 비선점 기반 대비 평균 정규화 예측 시간(ANTT)이 최대 7.8배 낮아지고, SLA 만족도가 1.4배 높아지며, 공정성은 19.6배 향상된다. 하드웨어 오버헤드는 극히 미미하다.

ABSTRACT

To amortize cost, cloud vendors providing DNN acceleration as a service to end-users employ consolidation and virtualization to share the underlying resources among multiple DNN service requests. This paper makes a case for a "preemptible" neural processing unit (NPU) and a "predictive" multi-task scheduler to meet the latency demands of high-priority inference while maintaining high throughput. We evaluate both the mechanisms that enable NPUs to be preemptible and the policies that utilize them to meet scheduling objectives. We show that preemptive NPU multi-tasking can achieve an average 7.8x, 1.4x, and 4.8x improvement in latency, throughput, and SLA satisfaction, respectively.

연구 동기 및 목표

  • 클라우드 기반 MLaaS 환경에서 저지연, 고처리량 딥러닝 추론을 위한 요구 증가에 대응하기 위해 선점 가능한 NPU를 지원하는 것.
  • 컨텍스트 스위칭 오버헤드를 최소화하는 DNN 워크로드에 특화된 경량 선점 메커니즘 설계.
  • 다중작업 NPU 환경에서 지연, 공정성, 처리량, SLA 준수를 균형 있게 조율하는 예측형 스케줄링 정책(PREMA) 개발.
  • 선점 메커니즘(체크포인팅 대비 죽임)과 스케줄링 정책이 시스템 전체 성능 지표에 미치는 영향 평가.

제안 방법

  • 컨텍스트 상태 크기와 선점 지연에 미치는 영향을 평가하기 위해 체크포인팅, 죽임, 하이브리드의 세 가지 NPU 선점 메커니즘 설계.
  • 스케줄링 결정을 위한 DNN 추론 시간 예측을 위해 경량 회귀 모델을 활용하여 예측 기반 작업 우선순위 부여.
  • 예측 실행 시간에 기반해 동적으로 작업 순서를 재정렬하는 선점형, 고우선순위 우선 스케줄링 정책 도입.
  • 32nm 공정 기반으로 16개 동시 작업을 위해 64비트 당 태스크 컨텍스트 추적 구조를 片내 SRAM에 구현하여 0.01 mm²의 면적만 차지.
  • 메모리 오버자원 사용을 처리하기 위해 오버플로된 체크포인트드 컨텍스트 상태를 DMA를 통해 CPU 메모리로 이동시키는 메모리 관리 전략 구현.
  • 실제 DNN(GoogLeNet, ResNet 등)을 다양한 배치 크기와 선점 지점에서 평가하며, 합성 워크로드 모델을 사용.

실험 결과

연구 질문

  • RQ1NPU에 대해 저오버헤드 작업 선점이 가능한 경량 선점 메커니즘을 설계할 수 있는가?
  • RQ2DNN 워크로드에서 선점이 체크포인트드 컨텍스트 상태 크기와 전체 선점 지연에 어떤 영향을 미치는가?
  • RQ3비선점 또는 우선순위 중심 스케줄러에 비해 예측 스케줄러가 지연, 처리량, SLA 준수에 얼마나 향상시킬 수 있는가?
  • RQ4ANTT, 공정성, 처리량 측면에서 선점된 작업에 대해 체크포인팅과 죽임 중 어느 것이 더 뛰어난 성능을 보이는가?
  • RQ5다양한 워크로드, 배치 크기, 선점 지점에서 PREMA 스케줄러의 성능에 대한 내구성은 어떠한가?

주요 결과

  • PREMA는 비선점 FCFS 스케줄링 대비 평균 정규화 예측 시간(ANTT)을 7.8배 향상시켰다.
  • 기본 비선점 스케줄러 대비 공정성은 19.6배 향상되고 처리량은 1.4배 증가했다.
  • SLA 위반 비율은 4.8배 감소하여 서비스 수준 목표 준수 능력이 뛰어나다는 것을 입증했다.
  • 체크포인팅은 ANTT에서 87%, STP에서 24%, 공정성에서 77% 더 우수했으며, 성능 오버헤드는 극히 미미했다.
  • 예측 모델은 실제 추론 시간과 98%의 상관관계를 보였으며, 오라클 접근 없이도 정확한 스케줄링 결정을 가능하게 했다.
  • 하드웨어 및 에너지 오버헤드는 극히 미미하다. 32nm 공정에서 16개 작업을 위한 SRAM은 0.01 mm² 뿐이며, 처리량 증가에 비례해 에너지 효율성이 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.