[논문 리뷰] Graphcore C2 Card performance for image-based deep learning application: A Report
이 논문은 ResNeXt101 모델을 사용하여 이미지 기반 딥러닝 추론에 대해 Graphcore C2 카드의 성능을 평가한다. Poplar SDK와 PopART 런타임을 활용하여 혼합 정밀도로 두 개의 IPU 프로세서를 동시에 사용함으로써, C2 카드는 배치 크기 12일 때 최소 지연 시간 1.36 ms와 최고 처리량 2,526.35장/초를 기록했으며, 에너지 효율성은 9.68장/초/와트로 정점에 도달한다.
Recently, Graphcore has introduced an IPU Processor for accelerating machine learning applications. The architecture of the processor has been designed to achieve state of the art performance on current machine intelligence models for both training and inference. In this paper, we report on a benchmark in which we have evaluated the performance of IPU processors on deep neural networks for inference. We focus on deep vision models such as ResNeXt. We report the observed latency, throughput and energy efficiency.
연구 동기 및 목표
- 실시간 이미지 기반 딥러닝 추론을 위한 Graphcore C2 카드의 성능 평가.
- ResNeXt101과 같은 대규모 비전 모델에서 IPU 프로세서의 지연 시간, 처리량, 에너지 효율성 측정.
- 배치 크기의 변화가 시스템 성능 및 효율성에 미치는 영향 평가.
- C2 카드가 실사용 규모의 저지연 응용 프로그램에 활용 가능한지 탐색.
제안 방법
- 벤치마크는 두 개의 IPU 프로세서를 탑재한 하나의 Graphcore C2 카드를 사용하여, 각 IPU가 병렬로 별도의 추론 세션을 처리하도록 수행되었다.
- ResNeXt101 모델은 PyTorch에서 ONNX 형식으로 내보내졌으며, PopART(팝라 SDK의 그래프 런타임)를 통해 실행되었다.
- 성능 향상과 효율성 향상을 위해 혼합 정밀도 추론이 적용되었으며, IPU 전용 최적화 기법이 활용되었다.
- 지연 시간, 처리량, 에너지 효율성을 배치 크기 2에서 12까지 측정하였으며, 전력 소모는 gc-monitor를 통해 모니터링되었다.
- 처리량은 초당 장 수로 계산되었으며, 에너지 효율성은 평균 전력 측정 기반으로 초당 장 수/와트로 계산되었다.
- 구현에 사용된 데이터는 COCO 검증 세트의 10,000장으로, 각 IPU는 크기 1~6의 마이크로 배치를 처리했다.
실험 결과
연구 질문
- RQ1다양한 배치 크기에서 ResNeXt101 추론에 대해 Graphcore C2 카드에서 확보할 수 있는 최소 지연 시간은 얼마인가?
- RQ2C2 카드에서 다양한 배치 크기에서 도달할 수 있는 처리량과 에너지 효율성 수준은 무엇인가?
- RQ3배치 크기가 증가함에 따라 C2 카드의 성능은 지연 시간과 에너지 효율성 측면에서 어떻게 스케일링되는가?
- RQ4C2 카드는 실시간, 저지연 추론 워크로드에서 높은 성능과 효율성을 유지할 수 있는가?
주요 결과
- C2 카드는 배치 크기 2일 때 최소 지연 시간 1.36 ms를 기록하여 실시간 응용 프로그램에 매우 민감한 반응성을 보였다.
- 배치 크기 12일 때 최고 처리량 2,526.35장/초를 기록하여 하중이 가중된 상황에서 높은 확장성을 보였다.
- 배치 크기 10일 때 에너지 효율성이 9.68장/초/와트로 정점에 도달하여 큰 배치에서 최적의 전력 효율성을 확보했다.
- 배치 크기 8 이상부터는 초당 장 수/와트 비율이 안정적으로 유지되어 고처리량 구성에서도 일관된 효율성을 보였다.
- 배치 크기 8에서 12로 증가함에 따라 에너지 소비 증가율이 최소화되어 처리량 최적화 워크로드에 적합함을 입증했다.
- 하드웨어와 SDK는 피이핑을 통한 모델 병렬 처리를 지원하여 단일 IPU 메모리 용량을 초월하는 더 큰 모델 배포가 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.