[논문 리뷰] A Study on the Intersection of GPU Utilization and CNN Inference
이 논문은 CNN 추론에서의 GPU 활용도를 조사하며, 높은 처리량이나 정확도를 보일지라도 모델 간에 큰 변동성을 보이고 있음을 밝혀냈다. 이를 바탕으로 신경망 아키텍처 탐색(NAS)에서 GPU 활용도를 경량 대체 지표로 사용할 것을 제안하며, 높은 정확도 평가에 의존하는 것을 줄여 검색 속도를 빠르게 할 잠재력을 보여주지만, 초도 결과에서는 검색 시간 또는 품질 향상이 제한적이었다.
There has been significant progress in developing neural network architectures that both achieve high predictive performance and that also achieve high application-level inference throughput (e.g., frames per second). Another metric of increasing importance is GPU utilization during inference: the measurement of how well a deployed neural network uses the computational capabilities of the GPU on which it runs. Achieving high GPU utilization is critical to increasing application-level throughput and ensuring a good return on investment for deploying GPUs. This paper analyzes the GPU utilization of convolutional neural network (CNN) inference. We first survey the GPU utilization of CNNs to show that there is room to improve the GPU utilization of many of these CNNs. We then investigate the GPU utilization of networks within a neural architecture search (NAS) search space, and explore how using GPU utilization as a metric could potentially be used to accelerate NAS itself. Our study makes the case that there is room to improve the inference-time GPU utilization of CNNs and that knowledge of GPU utilization has the potential to benefit even applications that do not target utilization itself. We hope that the results of this study will spur future innovation in designing GPU-efficient neural networks.
연구 동기 및 목표
- 이미지 분류에 사용되는 최신 CNN 아키텍처의 GPU 활용도를 분석하여, 높은 처리량이나 정확도를 보일지라도 활용도가 낮은 것을 드러내는 것.
- 산술 강도를 높이는 기법이 일반 목적의 CNN에서 GPU 활용도를 향상시킬 수 있는지 조사하는 것.
- GPU 활용도가 신경망 아키텍처 탐색(NAS)에서 정확도의 저비용 대체 지표로 기능할 수 있는지 평가하는 것.
- NAS에서 근사 필터링을 위한 GPU 활용도의 실현 가능성을 탐색하여 전체 학습 평가가 필요한 후보 수를 최소화하는 것.
제안 방법
- 다양한 수동 설계 및 NAS로 특정된 CNN 아키텍처를 대상으로 GPU 활용도를 추적하며, 처리량과 FLOPs 분석을 통해 활용도를 측정한 바.
- GPU 활용도의 핵심 원인인 산술 강도를 분석하고, 이전 연구(Kosaian et al., 2021)에서 제안한 기법을 일반 목적의 CNN에 적용하여 산술 강도를 향상시킨 바.
- NATS-Bench 검색 공간 내에서 모델 간 GPU 활용도와 정확도를 평가하여 상관관계를 파악한 바.
- 데이터 시스템에서의 근사 필터링 기법을 NAS에 응용하여, GPU 활용도를 사전 필터로 사용해 전체 정확도 학습이 필요한 후보 수를 줄인 바.
- 강화 학습 기반 NAS 시뮬레이션과 근사 필터링을 수행하여 정확도 대 대비 처리량의 파레토 경계를 비교한 바.
- GPU, 네트워크, 스토리지 대역폭 사용량을 비교함으로써 전체 정확도 평가와 GPU 활용도 추정 간 자원 효율성을 측정한 바.
실험 결과
연구 질문
- RQ1최신 CNN 아키텍처가 높은 처리량이나 정확도를 보일지라도 추론 중 GPU 활용도가 얼마나 높은 편인지, 어느 정도의 수준인지?
- RQ2이전에 전용 CNN에 사용된 산술 강도를 높이는 기법이 일반 목적의 CNN에서도 GPU 활용도 향상에 기여할 수 있는가?
- RQ3NAS 검색 공간 내에서 GPU 활용도와 정확도 간에 의미 있는 상관관계가 존재하는가?
- RQ4GPU 활용도가 정확도 평가에 비해 저비용으로 작동하여, 전체 정확도 평가 횟수를 줄여 NAS 검색 속도를 빠르게 할 수 있는가?
- RQ5NAS에서 근사 필터링을 위해 GPU 활용도를 사용할 경우, 검색 효율성과 해법 품질 간의 상충 관계는 어떠한가?
주요 결과
- 높은 처리량과 높은 정확도를 보이는 많은 CNN 아키텍처가 최적의 GPU 활용도를 보이지 않아, 성능 향상 잠재력이 여전히 남아 있음을 시사한다.
- 산술 강도를 높이는 기법이 일반 목적의 CNN에서 GPU 활용도와 처리량을 성공적으로 향상시켜, 이전 연구의 방법이 이식 가능함을 보여준다.
- NATS-Bench 검색 공간 내에서 GPU 활용도와 정확도 간에 양의 상관관계가 관찰되어, 활용도를 정확도의 대체 지표로 사용할 수 있음을 뒷받침한다.
- GPU 활용도를 활용한 근사 필터링은 전체 정확도 평가가 필요한 후보 수를 줄였지만, 얻어진 파레토 경계는 기준 방법과 비교해 근소하게만 향상되었다.
- GPU 활용도 평가는 단일 GPU만 필요했고 네트워크 및 스토리지 대역폭을 소비하지 않아 전체 정확도 학습보다 훨씬 자원 효율적이었다.
- 검색 시간이나 해법 품질 향상이 크게 관찰되지 않았지만, GPU 활용도 평가의 자원 효율성은 데이터센터 및 클라우드 환경에서 NAS의 확장성을 향상시킬 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.