Skip to main content
QUICK REVIEW

[논문 리뷰] A Unified Optimization Approach for CNN Model Inference on Integrated GPUs

Leyuan Wang, Zhi Chen|arXiv (Cornell University)|2019. 07. 03.
Advanced Neural Network Applications참고 문헌 30인용 수 4
한 줄 요약

이 논문은 다양한 엣지 디바이스의 통합 GPU에서 효율적인 CNN 추론을 위한 통합 최적화 프레임워크를 제안한다. 영역 특화의 중간 표현식(IR)과 기계학습 기반 스케줄링을 사용하여 시각 특화 연산자를 가속화하며, 벤더 최적화 라이브러리 대비 최대 1.62배의 성능 향상을 달성하면서도 더 넓은 모델 커버리지와 호환성을 위해 CPU로의 패러다임 전환도 지원한다.

ABSTRACT

Modern deep learning applications urge to push the model inference taking place at the edge devices for multiple reasons such as achieving shorter latency, relieving the burden of the network connecting to the cloud, and protecting user privacy. The Convolutional Neural Network (\emph{CNN}) is one of the most widely used model family in the applications. Given the high computational complexity of the CNN models, it is favorable to execute them on the integrated GPUs at the edge devices, which are ubiquitous and have more power and better energy efficiency than the accompanying CPUs. However, programming on integrated GPUs efficiently is challenging due to the variety of their architectures and programming interfaces. This paper proposes an end-to-end solution to execute CNN model inference on the integrated GPUs at the edge, which uses a unified IR to represent and optimize vision-specific operators on integrated GPUs from multiple vendors, as well as leverages machine learning-based scheduling search schemes to optimize computationally-intensive operators like convolution. Our solution even provides a fallback mechanism for operators not suitable or convenient to run on GPUs. The evaluation results suggest that compared to state-of-the-art solutions backed up by the vendor-provided high-performance libraries on Intel Graphics, ARM Mali GPU, and Nvidia integrated Maxwell GPU, our solution achieves similar, or even better (up to 1.62$ imes$), performance on a number of popular image classification and object detection models. In addition, our solution has a wider model coverage and is more flexible to embrace new models. Our solution has been adopted in production services in AWS and is open-sourced.

연구 동기 및 목표

  • 아키텍처의 이질성과 이식 가능 최적화의 부족으로 인해 엣지 디바이스의 통합 GPU에서 비효율적이고 이식성이 없는 GPU 추론 문제를 해결하기 위해.
  • 이전에 최적화가 부족하거나 CPU로 오프로드되었던 시각 특화 연산자에 대해 통합 GPU에서 고성능 실행을 가능하게 하기 위해.
  • 수동 저수준 커널 최적화 없이 다양한 SoC 플랫폼에서 성능 튜닝을 자동화하여 개발자 부담을 줄이기 위해.
  • GPU에서 실행이 불가능한 연산자에 대해 대체 메커니즘을 제공하여 광범위한 모델 호환성을 확보하기 위해.
  • 모델 이식성과 확장성을 유지하면서도, 벤더 최적화 라이브러리 수준의 성능을 달성하거나 초월하기 위해.

제안 방법

  • 통합 중간 표현식(IR)은 시각 특화 연산자를 추상화하고, 다양한 GPU 벤더에서 CUDA 및 OpenCL 코드 생성을 가능하게 한다.
  • 그래프 수준 및 텐서 수준에서 기계학습 기반 스케줄링을 적용하여 최적의 실행 계획을 탐색함으로써 수동 튜닝의 노력을 감소시킨다.
  • 일般적으로 GPU에서 비효율적인 흐름 제어가 많은 연산자(예: NMS, ROIAlign)를 위해 특화된 최적화를 포함한다.
  • 지원되지 않거나 최적의 성능을 내지 못하는 연산자는 동일한 SoC의 CPU로 라우팅하는 패러다임 전환 메커니즘을 포함한다. 이는 호환성과 성능을 보장한다.
  • Halide를 영감으로 삼은 컴파일러 유사 파이프라인에 기반하며, 통합 GPU의 고유한 특성을 처리하도록 확장되었다.
  • 강화 학습 또는 베이지안 최적화를 사용하여 성능 튜닝을 자동화함으로써 효율적인 스레드 및 메모리 레이아웃 탐색을 수행한다.

실험 결과

연구 질문

  • RQ1어떻게 복잡한 제어 논리를 가진 시각 특화 연산자를 이질적인 아키텍처의 통합 GPU에서 효율적으로 실행할 수 있는가?
  • RQ2통합 IR와 자동 스케줄링 전략이 다양한 통합 GPU에서 벤더 최적화 라이브러리 수준의 성능을 달성할 수 있는가?
  • RQ3자동화된 기계학습 기반 스케줄링이 엣지 CNN 추론에서 추론 지연과 에너지 효율성에 미치는 영향은 무엇인가?
  • RQ4통합 프레임워크는 다양한 SoC 플랫폼에서 고성능을 유지하면서도 다수의 인기 있는 CNN 모델을 어떻게 넓게 지원할 수 있는가?
  • RQ5GPU 가속이 불가능한 경우 CPU로의 패러다임 전환은 성능 손실 없이 모델 커버리지와 배포 유연성을 얼마나 향상시킬 수 있는가?

주요 결과

  • 제안된 프레임워크는 인텔, ARM, NVIDIA 통합 GPU에서 벤더 최적화 라이브러리(예: cuDNN, ACL, clDNN) 대비 최대 1.62배의 성능 향상을 달성한다.
  • ResNet, SSD, YOLO 등 다양한 이미지 분류 및 객체 검출 모델에서 최신 기술 수준의 솔루션과 비교해도 성능이 유사하거나 뛰어나다.
  • 기존 솔루션보다 더 넓은 범위의 모델을 지원하며, NMS나 ROIAlign과 같은 시각 특화 연산자가 자주 CPU로 오프로드되는 모델도 포함한다.
  • 기계학습 기반 스케줄링의 사용으로 수동 튜닝이 크게 감소하여 다양한 엣지 플랫폼으로의 신속한 배포가 가능해졌다.
  • 패러다임 전환 메커니즘이 모든 연산자가 GPU에서 실행 가능한 경우가 아니더라도 효율적으로 실행될 수 있도록 보장하여 모델 이식성을 향상시켰다.
  • 해당 솔루션은 AWS에서 실사용 환경에 배포되었으며 오픈소스로 공개되어 실제 적용 가능성과 확장성의 우수성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.