[논문 리뷰] Comparative Analysis of CPU and GPU Profiling for Deep Learning Models
이 논문은 PyTorch 및 NVIDIA 도구를 사용하여 딥러닝 모델의 CPU 및 GPU 프로파일링을 비교하며, GPU가 훈련 시간을 크게 단축시킴을 입증한다 (20 에포크 기준 CPU에서 13시간에서 GPU로 2시간으로). 이와 동시에 테스트 정확도는 유사하게 유지된다 (98–99%). 다양한 배치 크기에서 시간, 메모리, 전력 소비 및 온도의 차이를 정량화하여, 낮은 배치 크기에서는 GPU 메모리 활용도가 낮고, 데이터 로딩 중에는 CPU 활용도가 높다는 것을 밝혀냈다.
Deep Learning(DL) and Machine Learning(ML) applications are rapidly increasing in recent days. Massive amounts of data are being generated over the internet which can derive meaningful results by the use of ML and DL algorithms. Hardware resources and open-source libraries have made it easy to implement these algorithms. Tensorflow and Pytorch are one of the leading frameworks for implementing ML projects. By using those frameworks, we can trace the operations executed on both GPU and CPU to analyze the resource allocations and consumption. This paper presents the time and memory allocation of CPU and GPU while training deep neural networks using Pytorch. This paper analysis shows that GPU has a lower running time as compared to CPU for deep neural networks. For a simpler network, there are not many significant improvements in GPU over the CPU.
연구 동기 및 목표
- 딥러닝 모델 훈련 중 CPU 및 GPU 자원 활용도를 분석하고 비교하기.
- 프로파일링 도구를 사용하여 훈련 워크플로우의 성능 저하 요인을 규명하기.
- 배치 크기와 같은 하이퍼파라미터가 시간, 메모리 및 전력 소비에 미치는 영향 평가하기.
- 딥 네URAL 네트워크 훈련을 CPU 및 GPU에서 최적화하기 위한 실질적인 통찰 제공하기.
제안 방법
- 이중 NVIDIA A6000 GPU와 다중 코어 CPU를 탑재한 시스템에서 딥러닝 모델을 훈련하기 위해 PyTorch를 사용하였다.
- 각 훈련 단계에서 연산별 시간 및 메모리 사용량을 추적하고 로그 기록하기 위해 PyTorch Profiler와 TensorBoard를 활용하였다.
- NVIDIA 시스템 명령어 및 프로파일링 도구를 사용하여 GPU 및 CPU 활용도, 메모리 할당, 온도 및 전력 소비를 모니터링하였다.
- 확장성 및 자원 소비 차이를 평가하기 위해 배치 크기 64 및 128로 실험을 수행하였다.
- CPU 및 GPU 성능을 다양한 지표에서 비교하기 위해 추론 처리량과 훈련 시간을 측정하였다.
- 데이터를 GPU로 전송하는 등의 시간 소모가 큰 연산을 식별하기 위해 연산자 기반 프로파일링을 사용하여 실행 분해도를 시각화하였다.

실험 결과
연구 질문
- RQ1딥 네URAL 네트워크 훈련 중 GPU 활용도는 CPU 활용도와 어떻게 비교되는가?
- RQ2배치 크기가 GPU 및 CPU 메모리 소비 및 활용도에 어떤 영향을 미치는가?
- RQ3모델 훈련 중 CPU 및 GPU의 전력 소비 및 온도는 어떻게 변하는가?
- RQ4동일한 딥러닝 모델에 대해 CPU와 GPU 간 훈련 시간의 차이는 무엇인가?
- RQ5CPU 및 GPU 배포에서 추론 처리량은 어떻게 다를까?
주요 결과
- 동일한 모델을 CPU에서 훈련할 경우 20 에포크 기준 약 13시간이 소요되었고, GPU에서는 배치 크기 64로 2시간 만에 완료되었다.
- 배치 크기 64일 경우 GPU 활용도는 최대 50%에 도달했고, 배치 크기 128일 경우 70%로 증가하여 더 높은 배치 크기에서의 확장성이 뛰어나다는 것을 확인했다.
- CPU 메모리 사용량은 배치 크기와 관계없이 항상 32GB(총 512GB 중) 유지되었고, GPU 메모리 사용량은 배치 크기가 증가함에 따라 GPU:0에서 약 3.4GB에서 약 5GB로 증가했다.
- 배치 크기 128일 경우 GPU:0 온도는 최고 69°C에 도달했고, CPU 온도는 모든 설정에서 60–70°C 사이를 유지했다.
- GPU:0 전력 소비는 최대 152W(총 300W 중)에 도달했고, GPU:1은 오직 23W만 소비하여 GPU 간 부하 분포가 균형 잡히지 않았음을 나타냈다.
- CPU에서는 이미지당 추론 시간이 5초였고, GPU에서는 2–3초로 훨씬 빠르게, GPU 추론의 처리량 우수성이 뚜렷하게 드러났다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.