Skip to main content
QUICK REVIEW

[논문 리뷰] Tango: A Deep Neural Network Benchmark Suite for Various Accelerators

Aajna Karki, Chethan Palangotu Keshava|arXiv (Cornell University)|2019. 01. 14.
Advanced Neural Network Applications참고 문헌 23인용 수 8
한 줄 요약

Tango는 CUDA 및 OpenCL 기반의 딥 뉴럴 네트워크 벤치마크 세트로, 고유한 DNN 프레임워크나 라이브러리 없이 다양한 가속기에서 DNN 워크로드를 이식 가능하고 가볍게 평가할 수 있도록 한다. 이는 시뮬레이터, GPU, FPGA에서 다섯 개인 컨볼루션 네트워크(CNN)와 두 개인 순환 네트워크(RNN)의 세부 아키텍처 프로파일링을 제공하며, 메모리 액세스 패턴, 레지스터 사용량, 스케줄러 민감도에 대한 핵심 통찰을 드러낸다 — 특히 컨볼루션 레이어에서의 높은 데이터 국소성과 GPU 레지스터의 저활성화를 포함한다.

ABSTRACT

Deep neural networks (DNNs) have been proving the effectiveness in various computing fields. To provide more efficient computing platforms for DNN applications, it is essential to have evaluation environments that include assorted benchmark workloads. Though a few DNN benchmark suites have been recently released, most of them require to install proprietary DNN libraries or resource-intensive DNN frameworks, which are hard to run on resource-limited mobile platforms or architecture simulators. To provide a more scalable evaluation environment, we propose a new DNN benchmark suite that can run on any platform that supports CUDA and OpenCL. The proposed benchmark suite includes the most widely used five convolution neural networks and two recurrent neural networks. We provide in-depth architectural statistics of these networks while running them on an architecture simulator, a server- and a mobile-GPU, and a mobile FPGA.

연구 동기 및 목표

  • 자원 제약이 있는 플랫폼에서 평가하기 위해 고유한 DNN 프레임워크나 전용 라이브러리가 필요 없는 이식 가능하고 가벼운 DNN 벤치마크 세트의 부족을 해결하기 위해.
  • 아키텍처 시뮬레이터와 FPGAs와 같은 임베디드 가속기와 호환되는 벤치마크 세트를 제공하여 초기 단계의 하드웨어 평가를 가능하게 하기 위해.
  • 다양한 플랫폼, 즉 시뮬레이터, 서버 GPU, 모바일 GPU, FPGA에서 널리 사용되는 DNN 모델의 깊이 있는 아키텍처 프로파일링을 제공하기 위해.
  • 특히 컨볼루션 및 완전 연결 레이어에 대해 片상 메모리 계층 구조와 워프 스케줄링 정책이 DNN 성능에 미치는 영향을 분석하기 위해.

제안 방법

  • 벤치마크 세트는 CUDA C와 OpenCL로 완전히 구현되어 있으며, 고수준 DNN 프레임워크에 의존하지 않도록 DNN 연산을 저수준 수학 계산으로 분해한다.
  • 이것은 CUDA 또는 OpenCL를 지원하는 모든 플랫폼에서 다섯 개인 CNN(CifarNet, AlexNet, SqueezeNet, ResNet, VGGNet)과 두 개의 RNN(GRU, LSTM)의 인fer 전용 실행을 지원한다.
  • 아키텍처 특성은 Pascal GPU 구성이 적용된 수정된 GPGPU-Sim 아키텍처 시뮬레이터를 사용하여 수집되며, 캐시 크기와 스케줄러를 다양하게 조절한 제어 실험을 가능하게 한다.
  • 레지스터 파일 사용량, L2 캐시 미스, 워프 스케줄러 행동과 같은 성능 메트릭이 다양한 네트워크 레이어와 플랫폼 간에 측정되고 분석된다.
  • 이 벤치마크 세트는 시뮬레이터와 실제 하드웨어 간 일관된 평가를 가능하게 하여, 메모리 액세스 패턴과 자원 활용도와 같은 아키텍처적 트레이드오프를 직접 비교할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1다양한 플랫폼 간에 다양한 DNN 모델의 메모리 프로필은 어떻게 달라지며, 어떤 모델이 작은 임베디드 장치에 배포 가능한가?
  • RQ2DNN 워크로드에서 GPU 레지스터는 어느 정도 저활성화되어 있으며, 이는 다양한 네트워크 아키텍처에 따라 어떻게 달라지는가?
  • RQ3다양한 DNN 레이어 유형의 데이터 국소성은 어떻게 되며, 특히 L2 캐시 미스 비율 측면에서 성능에 어떤 영향을 미치는가?
  • RQ4DNN 실행 시간은 워프 스케줄러 정책에 얼마나 민감한가, 그리고 어떤 스케줄러가 다양한 DNN 모델에 대해 가장 우수한 성능을 보이는가?

주요 결과

  • 컨볼루션 레이어는 완전 연결 레이어보다 훨씬 높은 데이터 국소성을 보이며, L2 미스 비율이 1% 미만이지만 완전 연결 레이어는 10% 이상이다.
  • AlexNet과 ResNet은 Pascal GPU의 256 KB당 SM 레지스터 파일 용량의 50% 이상을 사용하지만, RNN은 20 KB 미만으로 사용되어 GPU 레지스터의 상당한 저활성화가 발생하고 있음을 시사한다.
  • LRR(기본 라운드로빈) 워프 스케줄러는 AlexNet과 ResNet에서 GTO 및 TLV보다 우수한 성능을 보이며, 특히 높은 데이터 국소성으로 인해 메모리 스탠드 오버헤드가 감소하여 컨볼루션 레이어에서 두드러진다.
  • GRU와 LSTM 모델은 500 KB 이내의 메모리에 맞기 때문에 작은 임베디드 장치에 적합하지만, 대부분의 CNN은 1MB 이상이 필요하여 FPGAs에서 레이어 분할이 필수적이다.
  • 온칩 메모리는 컨볼루션 레이어 최적화에 가장 효과적이며, 이는 높은 데이터 국소성 덕분이지만, 완전 연결 레이어와 같은 다른 메모리 집약적 레이어는 대체 최적화 기법이 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.