[논문 리뷰] DeepRT: A Soft Real Time Scheduler for Computer Vision Applications on the Edge
DeepRT는 GPU 자원이 제한된 다중 테넌트 엣지 서버에서 소프트 리얼타임 컴퓨터 비전 추론을 지원하기 위해 적응형 배치 및 마감시간 인지 스케줄링을 사용하는 엣지 기반 컴퓨터 비전 애플리케이션을 위한 소프트 리얼타임 GPU 스케줄러이다. 시간 창 기반 배치 전략과 오버런 처리를 위한 적응 모듈을 활용함으로써 DeepRT는 마감시간 위반을 최대 75% 감소시키고, 최신 기술 대비 처리량을 향상시킨다.
The ubiquity of smartphone cameras and IoT cameras, together with the recent boom of deep learning and deep neural networks, proliferate various computer vision driven mobile and IoT applications deployed on the edge. This paper focuses on applications which make soft real time requests to perform inference on their data - they desire prompt responses within designated deadlines, but occasional deadline misses are acceptable. Supporting soft real time applications on a multi-tenant edge server is not easy, since the requests sharing the limited GPU computing resources of an edge server interfere with each other. In order to tackle this problem, we comprehensively evaluate how latency and throughput respond to different GPU execution plans. Based on this analysis, we propose a GPU scheduler, DeepRT, which provides latency guarantee to the requests while maintaining high overall system throughput. The key component of DeepRT, DisBatcher, batches data from different requests as much as possible while it is proven to provide latency guarantee for requests admitted by an Admission Control Module. DeepRT also includes an Adaptation Module which tackles overruns. Our evaluation results show that DeepRT outperforms state-of-the-art works in terms of the number of deadline misses and throughput.
연구 동기 및 목표
- 제한된 GPU 자원을 가진 다중 테넌트 엣지 서버에서 소프트 리얼타임 컴퓨터 비전 추론을 지원하는 데 도전 과제를 해결하기 위해.
- 공유된 GPU 환경에서 낮은 지연 시간 보장을 유지하면서도 높은 시스템 처리량을 달성하기 위해.
- 다양한 애플리케이션에서 온 요청을 동적으로 배치하면서도 각 요청의 마감시간 제약 조건을 충족시킬 수 있는 스케줄러를 설계하기 위해.
- 런타임 적응을 통해 예측 불가능한 워크로드 변동과 오버런을 처리하기 위해.
- 엣지 기반 딥러닝 추론에서 마감시간 위반률과 처리량 측면에서 기존 시스템을 초월하기 위해.
제안 방법
- DeepRT는 시간 창 기반 배치 메커니즘을 사용하며, 창 내 요청의 최대 마감시간에 따라 배치 길이가 결정된다.
- DisBatcher 컴пон넌트는 여러 요청 간의 최대 배치를 달성하면서도 모든 요청이 지연 시간 마감시간을 충족하도록 보장한다.
- 승인 제어 모듈(Admission Control Module)은 현재 스케줄링 계획 하에서 마감시간을 충족시킬 수 있는 요청만 승인한다.
- 실행 워커(Execution Worker)는 GPU에서 순차적으로 배치를 처리하며, 비프리에프티브 실행 특성을 활용한다.
- 적응 모듈(Adaptation Module)은 오버런을 감지하고 동적으로 스케줄링 파rameter를 조정하여 마감시간 위반을 방지한다.
- 성능 프로파일링은 배치 및 모델 동시 실행이 지연 시간과 처리량에 미치는 영향을 분석하여 스케줄링 결정을 안내한다.
실험 결과
연구 질문
- RQ1엣지 기반 딥러닝 추론에서 배치 전략과 동시 모델 실행은 지연 시간과 처리량에 어떤 영향을 미치는가?
- RQ2여러 소프트 리얼타임 요청 간의 적응형 배치를 안전하게 적용할 수 있는가? 이때 개별 요청의 마감시간을 충족시킬 수 있는가?
- RQ3GPU 스케줄러는 마감시간 보장을 위반하지 않으면서도 워크로드 오버런을 어떻게 처리할 수 있는가?
- RQ4다중 테넌트 엣지 추론 워크로드에서 처리량과 마감시간 위반률 사이의 상충 관계는 어떻게 되는가?
- RQ5엣지 GPU에 특화된 스케줄러는 저지연, 소프트 리얼타임 환경에서 클라우드 최적화 시스템을 능가할 수 있는가?
주요 결과
- DeepRT는 동일한 워크로드 조건에서 최신 기술 대비 마감시간 위반 수를 최대 75% 감소시켰다.
- 시스템은 높은 처리량을 유지하였으며, 평가된 워크로드에서 Clipper 대비 최대 2.5배, DeepQuery 대비 최대 1.8배 높은 처리량을 달성했다.
- 적응 모듈은 강화된 내성성을 제공하여, 테스트 중 수동으로 삽입된 오버런 상황에서 마감시간 위반을 60% 감소시켰다.
- DisBatcher는 고도의 동시성 조건에서도 여러 요청의 데이터를 성공적으로 배치하면서 모든 요청이 마감시간을 충족시킴을 확인했다.
- 성능 프로파일링 결과, 배치 처리는 처리량을 증가시키지만 지연 시간 증가 위험을 수반하며, DeepRT는 마감시간 인지 시간 창 전략을 통해 이를 완화함을 확인했다.
- 승인 제어 모듈은 현재 조건 하에서 마감시간을 충족시킬 수 없는 요청을 거부함으로써 GPU 오버로딩을 효과적으로 방지했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.