[논문 리뷰] Low Latency CMOS Hardware Acceleration for Fully Connected Layers in Deep Neural Networks
이 논문은 딥 뉴럴 네트워크의 완전 연결(FC) 레이어를 위한 저지연 CMOS ASIC 가속기인 FC-ACCL을 제안한다. 128개의 병렬 8x8 또는 16x16 처리 요소(PE)와 128개의 고대역폭 메모리(HBM) 유닛을 사용하여, 새로운 컬럼-행-컬럼 스케줄링 방식으로 가중치를 저장하고 스트리밍한다. 이 설계는 4096×1000 FC8 레이어에서 100 MHz에서 48.4 GOPS의 성능을 달성하며, 이는 이전의 150 MHz에서 28.8 GOPS를 기록한 가속기보다 뛰어나다. 병렬성 최적화와 메모리 액세스 지연 최소화를 통해 성능을 극대화하였다.
We present a novel low latency CMOS hardware accelerator for fully connected (FC) layers in deep neural networks (DNNs). The FC accelerator, FC-ACCL, is based on 128 8x8 or 16x16 processing elements (PEs) for matrix-vector multiplication, and 128 multiply-accumulate (MAC) units integrated with 128 High Bandwidth Memory (HBM) units for storing the pretrained weights. Micro-architectural details for CMOS ASIC implementations are presented and simulated performance is compared to recent hardware accelerators for DNNs for AlexNet and VGG 16. When comparing simulated processing latency for a 4096-1000 FC8 layer, our FC-ACCL is able to achieve 48.4 GOPS (with a 100 MHz clock) which improves on a recent FC8 layer accelerator quoted at 28.8 GOPS with a 150 MHz clock. We have achieved this considerable improvement by fully utilizing the HBM units for storing and reading out column-specific FClayer weights in 1 cycle with a novel colum-row-column schedule, and implementing a maximally parallel datapath for processing these weights with the corresponding MAC and PE units. When up-scaled to 128 16x16 PEs, for 16x16 tiles of weights, the design can reduce latency for the large FC6 layer by 60 % in AlexNet and by 3 % in VGG16 when compared to an alternative EIE solution which uses compression.
연구 동기 및 목표
- 딥 뉴럴 네트워크 추론에서 완전 연결(FC) 레이어의 높은 지연을 해결하기 위해, 특히 AlexNet과 VGG16과 같은 모델에서의 성능 향상을 목표로 한다.
- 단일 사이클 내에 컬럼별로 특정 가중치에 액세스할 수 있도록 함으로써 FC 레이어의 메모리 액세스 병목 현상을 줄인다.
- FC 레이어의 처리량을 극대화하고 지연을 최소화하기 위해 고도로 병렬적이며 면적 효율적인 CMOS ASIC 아키텍처를 설계한다.
- 기존 하드웨어 가속기보다 처리 지연을 줄이면서도 온칩 자원의 고도로 활용된 성능을 달성한다.
제안 방법
- FC-ACCL 아키텍처는 완전 연결 레이어에서 행렬-벡터 곱셈을 수행하기 위해 128개의 병렬 8x8 또는 16x16 처리 요소(PE)를 활용한다.
- 128개의 고대역폭 메모리(HBM) 유닛을 통합하여 전체 가중치 행렬을 저장하고 스트리밍하며, 단일 사이클 내에 컬럼별 액세스를 가능하게 한다.
- MAC 및 PE 유닛의 유휴 사이클을 줄이고 데이터 재사용을 최적화하기 위해 새로운 컬럼-행-컬럼 메모리 액세스 스케줄링 전략을 사용한다.
- 데이터 경로는 완전히 병렬화되어 있으며, 각 PE 및 MAC 유닛이 동기화되어 최대 처리량을 달성한다.
- 가중치는 16x16 블록 단위로 처리되는 타일링 아키텍처를 사용하여 더 큰 FC 레이어로의 효율적 확장이 가능하다.
- CMOS ASIC 구현에 최적화된 마이크로아키텍처를 설계하였으며, 128개의 PE에 대한 정밀한 타이밍 및 면적 분석을 수행하였다.
실험 결과
연구 질문
- RQ1메모리 액세스 패턴을 최적화함으로써 기존 FC 레이어 가속기보다 낮은 지연을 달성할 수 있는가?
- RQ2컬럼-행-컬럼 메모리 스케줄링 전략은 FC 레이어 추론의 지연과 처리량에 어떤 영향을 미치는가?
- RQ3PE 및 MAC 유닛의 병렬성은 얼마나 극대화될 수 있으며, 이는 GOPS 성능 향상에 어떤 기여를 하는가?
- RQ4AlexNet의 큰 FC6 레이어와 VGG16의 FC8 레이어에 대해 제안된 아키텍처는 지연 감소 측면에서 얼마나 잘 확장되는가?
- RQ5압축된 EIE 기반 솔루션 대비 FC-ACCL 설계는 지연과 처리량 측면에서 얼마나 높은 성능 향상을 달성하는가?
주요 결과
- FC-ACCL 가속기는 4096×1000 FC8 레이어에서 100 MHz 클럭에서 48.4 GOPS 성능을 달성하였으며, 이는 이전의 150 MHz에서 28.8 GOPS를 기록한 가속기보다 뚜렷이 뛰어나다.
- 새로운 컬럼-행-컬럼 메모리 액세스 스케줄링 전략은 단일 사이클 내에 컬럼별로 특정 가중치에 액세스할 수 있도록 하여 메모리 지연을 감소시키고 자원 활용도를 향상시켰다.
- 128개의 16x16 PE로 확장함으로써 AlexNet의 큰 FC6 레이어에서 기존의 EIE 기반 솔루션 대비 지연을 60% 감소시켰다.
- VGG16의 FC8 레이어에서는 동일한 EIE 기반 솔루션 대비 지연을 3% 감소시켰다.
- 128개의 MAC 유닛과 128개의 PE를 최대한 병렬로 활용하는 데이터 경로 설계로 인해 처리량이 극대화되었으며, 유휴 사이클이 최소화되었다.
- 메모리 대역폭과 스케줄링 전략이 FC 레이어 가속에서 핵심적인 병목 요소임을 입증하였으며, 이들의 최적화로 상당한 성능 향상이 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.