Skip to main content
QUICK REVIEW

[논문 리뷰] Integrating NVIDIA Deep Learning Accelerator (NVDLA) with RISC-V SoC on FireSim

Farzad Farshchi, Qijing Huang|arXiv (Cornell University)|2019. 03. 05.
CCD and CMOS Imaging Sensors참고 문헌 10인용 수 4
한 줄 요약

이 논문은 Amazon FPGAs에서 FireSim를 사용하여 RISC-V SoC에 통합된 NVDLA DNN 가속기의 클라우드 기반 사이클 정확한 시뮬레이션을 제시한다. 이는 비용 효율적이고 고정밀 성능 분석을 가능하게 한다. 주요 기여는 YOLOv3 추론에서 NVDLA가 7.5 fps를 달성했으며, 최종 레벨 캐시 공유를 통해 최대 1.56배의 성능 향상을 보였고, CPU와 NVDLA가 메모리 서브시스템을 공유할 경우 최대 2.5배의 저하가 발생하는 심각한 메모리 간섭 현상을 규명했다.

ABSTRACT

NVDLA is an open-source deep neural network (DNN) accelerator which has received a lot of attention by the community since its introduction by Nvidia. It is a full-featured hardware IP and can serve as a good reference for conducting research and development of SoCs with integrated accelerators. However, an expensive FPGA board is required to do experiments with this IP in a real SoC. Moreover, since NVDLA is clocked at a lower frequency on an FPGA, it would be hard to do accurate performance analysis with such a setup. To overcome these limitations, we integrate NVDLA into a real RISC-V SoC on the Amazon cloud FPGA using FireSim, a cycle-exact FPGA-accelerated simulator. We then evaluate the performance of NVDLA by running YOLOv3 object-detection algorithm. Our results show that NVDLA can sustain 7.5 fps when running YOLOv3. We further analyze the performance by showing that sharing the last-level cache with NVDLA can result in up to 1.56x speedup. We then identify that sharing the memory system with the accelerator can result in unpredictable execution time for the real-time tasks running on this platform. We believe this is an important issue that must be addressed in order for on-chip DNN accelerators to be incorporated in real-time embedded systems.

연구 동기 및 목표

  • 연구를 위한 물리적 FPGA 기반 NVDLA 통합의 높은 비용과 성능 제약를 극복하기 위해.
  • 실제 RISC-V SoC 환경에서 NVDLA의 정확한 사이클 정확한 성능 평가를 가능하게 하기 위해.
  • 다중코어 시스템에서 공유 메모리 및 캐시 자원이 NVDLA 성능에 미치는 영향을 조사하기 위해.
  • 임베디드 시스템에서 실시간 DNN 추론에 영향을 주는 공유 메모리 시스템 내의 핵심 간섭 문제를 규명하기 위해.
  • RISC-V에서 DNN 가속기 연구를 위한 공개 가능하고 오픈소스의 시뮬레이션 플랫폼을 제공하기 위해.

제안 방법

  • Verilog과 FireSim의 하드웨어-소프트웨어 공동 시뮬레이션 프레임워크를 사용하여 FireSim 최적화된 RISC-V Rocket Chip SoC 설계에 NVDLA를 통합한다.
  • Amazon 클라우드 FPGAs에서 FireSim의 FPGA 가속, 사이클 정확한 시뮬레이션을 사용하여 L2 캐시와 DRAM을 포함한 실제적인 메모리 서브시스템을 모델링한다.
  • 대상 SoC를 호스트 FPGA의 DRAM 컨트롤러에서 분리하고 가변 메모리 모델로 교체하여 정밀한 성능 측정을 가능하게 한다.
  • 공유된 최종 레벨 캐시(LLC)를 구성하고 캐시 크기, 블록 크기 등 파rameter를 변화시켜 NVDLA 성능에 미치는 영향을 평가한다.
  • CPU 코어에서 메모리 집약적인 워크로드(BwWrite)를 공유 코어 스케줄링하여 NVDLA의 YOLOv3 추론을 공유함으로써 간섭 효과를 측정한다.
  • 다양한 메모리 경쟁 수준(L1, LLC, DRAM 워킹 세트 크기)과 코어 수(1~4)에서 NVDLA 실행 시간을 측정하고 정규화한다.

실험 결과

연구 질문

  • RQ1실제 FPGA에서의 성능와 비교하여 시뮬레이션된 사이클 정확한 환경에서 NVDLA의 YOLOv3 추론 성능는 어떻게 되는가?
  • RQ2CPU와 NVDLA가 최종 레벨 캐시를 공유할 경우 DNN 추론 처리량에 어떤 영향을 미치는가?
  • RQ3CPU 워크로드와 NVDLA 간의 메모리 경쟁은 실시간 시스템에서 DNN 추론의 예측 가능성과 지연에 어떤 영향을 미치는가?
  • RQ4캐시 블록 크기가 공간 국소성 활용을 통해 NVDLA 성능 최적화에 어떤 역할을 하는가?
  • RQ5CPU와 가속기 간의 공유 메모리 액세스가 특히 안전 기반 임베디드 애플리케이션에서 예측 불가능한 실행 시간을 초래할 정도로 어느 정도의 영향을 미치는가?

주요 결과

  • FireSim 시뮬레이션된 RISC-V SoC에서 NVDLA는 YOLOv3 객체 검출을 7.5 fps로 실행하여 임베디드 애플리케이션에 적합한 추론 성능를 입증했다.
  • NVDLA와 최종 레벨 캐시를 공유할 경우 최대 1.56배의 성능 향상을 기록했으며, 128바이트 캐시 블록 크기에서 공간 국소성의 효과가 가장 잘 드러났다.
  • LLC 공유의 성능 향상은 블록 크기에 민감하며, 128바이트 블록 크기와 4096 KiB 캐시 용량에서 1.51배의 성능 향상을 기록했다.
  • 공동 위치한 CPU 워크로드에서 발생하는 메모리 간섭은 CPU 워킹 세트가 DRAM에 맞는 경우 네 개의 BwWrite 작업이 활성화되어 있을 때 NVDLA 실행 속도가 최대 2.5배 저하되었다.
  • CPU 워크로드가 L1 캐시에만 포함될 경우 간섭은 미미하지만, 공유된 LLC 또는 DRAM에 액세스할 경우 간섭이 크게 증가하여 실시간 시스템의 핵심 버팀목이 됨을 확인했다.
  • 결과는 실시간 임베디드 시스템에서 온칩 가속기를 사용할 경우 예측 가능한 성능을 확보하기 위해 메모리 대역폭 분할 또는 우선순위 스케줄링과 같은 QoS 메커니즘이 강력히 필요하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.