[논문 리뷰] A Highly Configurable Hardware/Software Stack for DNN Inference Acceleration
이 논문은 TVM/VTA 스택에 파ip라이닝된 ALU 및 GEMM 유닛, 가변 메모리 폭(8–64 바이트/사이클) 및 새로운 명령어를 추가하여 DNN 추론 가속을 위한 고도로 구성 가능한 하드웨어/소프트웨어 스택을 제안한다. 이로 인해 12배의 면적 증가를 감수하면서도 최대 11.5배의 사이클 수 감소를 달성하였으며, ResNet 및 MobileNet에 대한 엔드 투 엔드 지원이 가능해졌다. 이에 따라 영역-성능 트레이드오프를 수십 개의 구성에 걸쳐 신속하게 탐색할 수 있는 Agile한 기능별 접근 방식이 가능해졌다.
This work focuses on an efficient Agile design methodology for domain-specific accelerators. We employ feature-by-feature enhancement of a vertical development stack and apply it to the TVM/VTA inference accelerator. We have enhanced the VTA design space and enabled end-to-end support for additional workloads. This has been accomplished by augmenting the VTA micro-architecture and instruction set architecture (ISA), as well as by enhancing the TVM compilation stack to support a wide range of VTA configs. The VTA tsim implementation (CHISEL-based) has been enhanced with fully pipelined versions of the ALU/GEMM execution units. In tsim, memory width can now range between 8-64 bytes. Field widths have been made more flexible to support larger scratchpads. New instructions have been added: element-wise 8-bit multiplication to support depthwise convolution, and load with a choice of pad values to support max pooling. Support for more layers and better double buffering has also been added. Fully pipelining ALU/GEMM helps significantly: 4.9x fewer cycles with minimal area change to run ResNet-18 under the default config. Configs featuring a further 11.5x decrease in cycle count at a cost of 12x greater area can be instantiated. Many points on the area-performance pareto curve are shown, showcasing the balance of execution unit sizing, memory interface width, and scratchpad sizing. Finally, VTA is now able to run Mobilenet 1.0 and all layers for ResNets, including the previously disabled pooling and fully connected layers. The TVM/VTA architecture has always featured end-to-end workload evaluation on RTL in minutes. With our modifications, it now offers a much greater number of feasible configurations with a wide range of cost vs. performance. All capabilities mentioned are available in opensource forks while a subset of these capabilities have already been upstreamed.
연구 동기 및 목표
- 도메인 특화 가속기의 비재사용 엔지니어링(NRE) 비용을 줄이기 위해 빠르고 구성 가능한 하드웨어/소프트웨어 공동 설계를 가능하게 하기 위해.
- VTA 가속기 스택의 성능, 구성 가능성 및 복잡한 DNN 워크로드(예: ResNet 및 MobileNet)에 대한 엔드 투 엔드 지원을 향상시키기 위해.
- 지속적 통합과 빠른 엔드 투 엔드 검증을 지원하는 하드웨어와 소프트웨어를 함께 설계하는 Agile하고 점진적인 방법론을 개발하기 위해.
- RTL, 시뮬레이션, FPGA 플랫폼에서 정확성을 유지하면서 설계 공간을 확장하여 영역-성능 트레이드오프를 탐색하기 위해.
- 업스트림 기여와 재사용 가능한 플로우를 통해 효율적이고 오픈소스 기반의 DNN 추론 가속기용 하드웨어/소프트웨어 공동 설계를 가능하게 하기 위해.
제안 방법
- 최소한의 VTA 구현에서 시작하여 점진적으로 TVM/VTA 스택을 향상시키기 위해 Agile하고 기능별로 개발하는 방법론을 사용하였다.
- 사이클 수를 크게 감소시키기 위해 완전히 파이프라인된 ALU 및 GEMM 유닛을 VTA 마이크로아키텍처에 통합하였다.
- 메모리 인터페이스 폭(8–64 바이트/사이클)과 ISA 내 필드 폭을 파rameterized하여 다양한 구성과 더 큰 스크래치패드를 지원하였다.
- 8비트 요소별 곱셈, 최대 풀링을 위한 패딩 선택적 로드, 그리고 공통적인 ResNet 패턴을 가속화하기 위한 클립 명령어를 추가하였다.
- TVM 컴파일러 스택을 확장하여 최적화된 uop 생성, 더블 버퍼링 지원, 그리고 풀 커넥티드 레이어를 포함한 새로운 레이어 처리를 가능하게 하였다.
- 모든 단계에서 정확성을 보장하기 위해 fsim(행동 모델), tsim(Verilator 기반 RTL 시뮬레이션), FPGA 시뮬레이션을 포함한 지속적 통합 파이프라인을 구현하였다.
실험 결과
연구 질문
- RQ1어떻게 Agile하고 점진적인 방법론이 도메인 특화 가속기 개발에서 NRE 비용을 줄일 수 있는가?
- RQ2구성 가능한 가속기에서 ResNet 및 MobileNet과 같은 복잡한 DNN에 대한 엔드 투 엔드 지원을 가능하게 하기 위해 어떤 하드웨어 및 소프트웨어 개선이 필요한가?
- RQ3파이프라인화와 파라미터화는 최소한의 면적 증가로 성능을 얼마나 향상시킬 수 있는가?
- RQ4통합된 하드웨어/소프트웨어 공동 설계 플로우를 통해 수십 개의 구성에 걸쳐 영역-성능 트레이드오프를 신속하게 탐색할 수 있는가?
- RQ5시뮬레이션과 지속적 통합은 반복적인 하드웨어 및 컴파일러 개선 과정에서 정확성을 유지하는 데 어떤 역할을 하는가?
주요 결과
- 완전히 파이프라인된 ALU 및 GEMM 유닛은 기본 설정에서 ResNet-18에 대해 사이클 수를 약 4.9배 감소시켰으며 면적 증가 폭은 미미하였다.
- 구성 매개변수를 조정함으로써 추가로 약 11.5배의 사이클 수 감소를 달성하였고, 이는 약 12배의 면적 증가를 수반하였다. 이는 넓은 성능-면적 트레이드오프 공간을 보여주었다.
- 성능-면적 파레토 곡선 상에서 수십 개의 중간 구성이 노출되어 실행 단위 크기, 메모리 폭, 스크래치패드 크기의 체계적 탐색이 가능해졌다.
- 향상된 스택은 이제 ResNet 및 MobileNet 1.0의 모든 레이어를 지원하며, 이전에 지원하지 못했던 풀링 및 풀 커넥티드 레이어까지 포함된다.
- RTL 기반 엔드 투 엔드 워크로드 평가가 이제 몇 분 내로 수행되어 공동 설계 및 DNN 아키텍처 탐색을 위한 빠른 피드백이 가능해졌다.
- 중요한 메모리 타이밍 버그는 오직 FPGA 플랫폼에서 발견되었으며, 빠른 RTL 시뮬레이션에도 불구하고 FPGA 수준의 통합 테스트의 가치를 부각시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.