[논문 리뷰] Transaction-level Model Simulator for Communication-Limited Accelerators
이 논문은 컨volutional 네트워크(CNN) 가속기용 사전 RTL 사이클 정확도 시뮬레이터인 AccTLMSim을 제안한다. 이는 DRAM 지연과 버스 프로토콜 오버헤드를 고려하여 통신 대역폭을 모델링한다. 새로운 성능 추정 모델을 통해 기존 방법보다 정확도와 속도 면에서 뛰어난 성능을 발휘하며, 수백만 개의 아키텍처 옵션을 수십 분 내로 신속하고 정확하게 탐색할 수 있다.
Rapid design space exploration in early design stage is critical to algorithm-architecture co-design for accelerators. In this work, a pre-RTL cycle-accurate accelerator simulator based on SystemC transaction-level modeling (TLM), AccTLMSim, is proposed for convolutional neural network (CNN) accelerators. The accelerator simulator keeps track of each bus transaction between accelerator and DRAM, taking into account the communication bandwidth. The simulation results are validated against the implementation results on the Xilinx Zynq. Using the proposed simulator, it is shown that the communication bandwidth is severely affected by DRAM latency and bus protocol overhead. In addition, the loop tiling is optimized to maximize the performance under the constraint of on-chip SRAM size. Furthermore, a new performance estimation model is proposed to speed up the design space exploration. Thanks to the proposed simulator and performance estimation model, it is possible to explore a design space of millions of architectural options within a few tens of minutes.
연구 동기 및 목표
- CNN 가속기의 통신 병목 현상을 정확하게 모델링하는 사전 RTL 시뮬레이터의 부족을 보완한다.
- 기존 시뮬레이터가 정적 통신 대역폭을 가정하여 DRAM 지연과 버스 프로토콜 오버헤드의 동적 영향을 간과하는 한계를 극복한다.
- 온칩 SRAM 제약 조건이 있는 통신 제한된 CNN 가속기의 효율적이고 정확한 설계 공간 탐색을 가능하게 한다.
- 사이클 정확도 시뮬레이션과 비교해도 높은 정확도를 유지하면서 탐색 속도를 높이는 성능 추정 모델을 개발한다.
- 여러 층에 걸쳐 제약 조건이 없는 루프 타일링 전략(예: 타일 크기 및 언롤 팩터 최적화)을 최적화하여 성능을 극대화한다.
제안 방법
- 모든 버스 트랜잭션을 사이클 정확도로 추적하는 SystemC 기반 트랜잭션 레벨 모델(AccTLMSim)을 설계한다.
- 실제 DRAM 지연과 AXI 버스 프로토콜 오버헤드를 시뮬레이션에 통합하여 동적 통신 대역폭을 모델링한다.
- 정확도를 확보하기 위해 Xilinx Zynq FPGA 구현 결과와 시뮬레이터를 검증한다.
- 시뮬레이션 데이터에서 유도된 경험적 스케일링 인자에 기반한 새로운 성능 추정 모델을 제안하여 정적 가정을 대체한다.
- 추정 모델을 시뮬레이터에 통합하여 전체 시뮬레이션 전에 설계 공간을 필터링(예: 상위 0.1%)함으로써 탐색 시간을 극적으로 단축시킨다.
- 여러 컨volutional 레이어에 걸쳐 제약 조건이 없는 루프 타일링을 지원하도록 프레임워크를 확장하여 각 레이어의 타일 크기와 언롤 팩터를 개별 최적화할 수 있도록 한다.
실험 결과
연구 질문
- RQ1DRAM 지연과 버스 프로토콜 오버헤드는 CNN 가속기에서 효과적인 통신 대역폭에 어떤 영향을 미치는가?
- RQ2RTL 구현 없이도 사이클 정확도 TLM 기반 시뮬레이터가 통신 제한된 성능을 정확하게 모델링할 수 있는가?
- RQ3제안된 성능 추정 모델은 기존 모델 대비 설계 공간 탐색에서 정확도와 속도 면에서 어떻게 비교되는가?
- RQ4여러 컨볼루션 레이어에 걸쳐 제약 조건이 없는 루프 타일링을 사용할 경우 제약 조건이 있는 타일링 대비 성능 향상은 어느 정도인가?
- RQ5제안된 추정 모델은 대규모 설계 공간 탐색에서 정확도를 유지하면서 탐색 시간을 얼마나 줄일 수 있는가?
주요 결과
- CNN 가속기에서 통신 대역폭은 정점 대역폭뿐만 아니라 DRAM 지연과 버스 프로토콜 오버헤드로 인해 동적으로 제한된다.
- 제안된 시뮬레이터는 Xilinx Zynq FPGA 결과와의 검증을 통해 실제 성능을 정확하게 반영한다.
- 새로운 성능 추정 모델은 설계 공간 탐색 시간을 수십만 배 이상 단축시키면서도 높은 정확도를 유지하며, 기존 모델조차도 상위 1% 필터링 조건에서도 열등하다.
- 여러 레이어에 걸쳐 제약 조건이 없는 루프 타일링은 타일 크기의 각 레이어 최적화 덕분에 제약 조건이 있는 타일링 대비 최대 25.5%의 성능 향상을 이룬다.
- 제안된 모델을 통해 수백만 개의 아키텍처 옵션을 수십 분 내로 탐색할 수 있어 대규모 최적화가 가능해졌다.
- 기존 모델에서 경험적으로 선택된 스케일링 인자는 특히 SRAM 크기가 15,000 픽셀/가중치를 초과할 경우 심각한 성능 저하를 초래함을 시사하며, 정확한 모델링의 필요성을 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.