Skip to main content
QUICK REVIEW

[논문 리뷰] QuTiBench: Benchmarking Neural Networks on Heterogeneous Hardware

Michaela Blott, Lisa Halder|arXiv (Cornell University)|2019. 09. 11.
Advanced Neural Network Applications참고 문헌 51인용 수 5
한 줄 요약

QuTiBench는 이종 하드웨어 플랫폼에서 신경망 성능을 평가하기 위해 설계된 혁신적인 다층 벤치마크 세트로, 양자화와 같은 알고리즘 최적화를 지원하며 정확도, 지연 시간, 에너지 효율성 간의 시스템 수준 비교를 가능하게 한다. 이는 임베디드 및 엣지 환경에서 FPGA, GPU, CPU에서의 성능 저하 요인과 상호 보완적 특성에 대한 통찰을 제공하는 확장 가능한 하드웨어-소프트웨어 공동 설계 프레임워크를 제공한다.

ABSTRACT

Neural Networks have become one of the most successful universal machine learning algorithms. They play a key role in enabling machine vision and speech recognition for example. Their computational complexity is enormous and comes along with equally challenging memory requirements, which limits deployment in particular within energy constrained, embedded environments. In order to address these implementation challenges, a broad spectrum of new customized and heterogeneous hardware architectures have emerged, often accompanied with co-designed algorithms to extract maximum benefit out of the hardware. Furthermore, numerous optimization techniques are being explored for neural networks to reduce compute and memory requirements while maintaining accuracy. This results in an abundance of algorithmic and architectural choices, some of which fit specific use cases better than others. For system level designers, there is currently no good way to compare the variety of hardware, algorithm and optimization options. While there are many benchmarking efforts in this field, they cover only subsections of the embedded design space. None of the existing benchmarks support essential algorithmic optimizations such as quantization, an important technique to stay on chip, or specialized heterogeneous hardware architectures. We propose a novel benchmark suite, QuTiBench, that addresses this need. QuTiBench is a novel multi-tiered benchmarking methodology that supports algorithmic optimizations such as quantization and helps system developers understand the benefits and limitations of these novel compute architectures in regard to specific neural networks and will help drive future innovation. We invite the community to contribute to QuTiBench in order to support the full spectrum of choices in implementing machine learning systems.

연구 동기 및 목표

  • 임베디드 시스템에서 신경망의 알고리즘 최적화(예: 양자화)와 이종 하드웨어 플랫폼을 동시에 평가할 수 있는 종합적인 벤치마크가 부족한 문제를 해결하기 위해.
  • 다양한 하드웨어 및 소프트웨어 구성 간에 공정하고 재현 가능한 비교를 가능하게 하는 표준화된 다층 벤치마킹 방법론을 시스템 설계자에게 제공하기 위해.
  • 신경망 워크로드를 다양한 추상화 수준에서 분석함으로써 계산, 메모리 액세스, 또는 데이터 이동과 같은 성능 저하 요인을 규명하기 위해.
  • 하드웨어 특성과 최종 애플리케이션 성능 및 정확도 간의 연계를 통해 알고리즘과 가속기의 공동 설계를 지원하기 위해.
  • FPGA, GPU, CPU, DPU를 포함한 임베디드 환경에서 확장 가능하고 확장 가능한 벤치마크 세트를 제공함으로써 커뮤니티 기반 혁신을 촉진하기 위해.

제안 방법

  • QuTiBench는 이론적 분석, 알고리즘 최적화, 시스템 수준 성능 평가를 아우르는 다층 벤치마킹 접근법(Ti)을 활용한다.
  • 양자화와 같은 알고리즘 최적화를 지원하여, 정확도를 유지하면서도 저정밀도 표현(예: 삼치수, 이진)의 평가를 가능하게 한다.
  • 다양한 하드웨어 플랫폼(FPGA: ZCU104, GPU: NVIDIA TX2, CPU 포함)에서 신경망을 평가하며, 여러 성능 메트릭을 사용한다.
  • 시스템 수준 성능은 데이터 이동 오버헤드, 계산 시간, 지연 시간, 전력 소비, 처리량(GOP/s, TOP/s) 등을 포함하여 측정된다.
  • 정확도, 지연 시간, 에너지 효율성 간의 상호 보완적 특성을 시각화하기 위해 파레토 곡선을 사용한다.
  • deep500.org에 영감을 받은 인프라를 통해 자동화된 테스트 및 재현 가능성을 지원하기 위해 기존 노력(예: MLPerf)과 통합된다.

실험 결과

연구 질문

  • RQ1양자화된 및 정밀도가 높은 신경망을 실행할 때, FPGA, GPU, CPU와 같은 다양한 하드웨어 플랫폼 간의 지연 시간, 처리량, 에너지 효율성은 어떻게 비교될 수 있는가?
  • RQ2양자화와 같은 알고리즘 최적화는 정확도를 손상시키지 않으면서도 이종 가속기에서 성능 향상과 자원 사용 감소에 얼마나 기여하는가?
  • RQ3신경망 추론 파이프라인에서 성능 저하 요인은 어디에 존재하는가? 계산 유닛, 메모리 대역폭, 또는 구성 요소 간 데이터 이동에서인가?
  • RQ4다층 벤치마킹 접근법은 다양한 하드웨어 및 알고리즘 구성 간의 정확도, 지연 시간, 에너지 효율성 간의 상호 보완적 특성을 효과적으로 포괄할 수 있는가?
  • RQ5벤치마킹 프레임워크는 임베디드 및 엣지 컴퓨팅 환경에서 새로운 가속기인 DPU와 재구성 가능한 FPGA를 지원하도록 어떻게 확장될 수 있는가?

주요 결과

  • GPU 플랫폼은 더 잘 최적화된 하드웨어 덕분에 FPGA보다 높은 전력 효율성을 보였으며, 정지 전력은 5W(TX2) 대비 19.9W(ZCU104)로 나타났다.
  • GPU의 지연 시간은 배치 크기에 따라 8ms에서 1838.5ms까지 변동했고, FPGA의 지연 시간은 9.65ms에서 65ms까지 변동하여 FPGA에서 높은 성능 일관성을 보였다.
  • 양자화를 통해 정확도에 미치는 영향을 최소화하면서도 하드웨어 비용을 크게 절감할 수 있었으며, 이는 이전 연구(Blott et al., 2017)에서 입증된 linh, 임베디드 배포에서의 중요성을 재확인하였다.
  • 벤치마크는 데이터 이동 오버헤드가 시스템 수준 지연의 일관된 구성 요소임을 드러내었으며, 이는 온칩 데이터 스트리밍을 고려한 최적화 전략 수립이 필요함을 시사한다.
  • 파레토 곡선은 정확도와 성능 간의 상호 보완적 특성을 효과적으로 시각화하여 다양한 네트워크 구조 및 하드웨어 플랫폼 간의 명확한 비교를 가능하게 하였다.
  • 다층 접근법은 반복 계층 또는 완전 연결 계층과 같은 성능 저하 요인을 성공적으로 식별하였으며, 메모리 액세스가 시스템 성능에 미치는 역할을 부각시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.