[논문 리뷰] MPNA: A Massively-Parallel Neural Array Accelerator with Dataflow Optimization for Convolutional Neural Networks
이 논문은 CNN의 컨volutional(CONV) 및 풀연결(FC) 레이어를 동시에 가속화하기 위해 이질적인 사이클로이드 어레이와 최적화된 데이터플로우를 갖춘 대규모 병렬 신경 어레이 가속기인 MPNA를 제안한다. 높은 데이터 재사용과 효율적인 메모리 액세스를 통해 기준 아키텍처 대비 1.7배 높은 성능과 51%의 에너지 절감을 달성하였으며, 28nm ASIC 구현에서 280MHz에서 149.7 GOPS/W의 성능을 기록하였다.
The state-of-the-art accelerators for Convolutional Neural Networks (CNNs) typically focus on accelerating only the convolutional layers, but do not prioritize the fully-connected layers much. Hence, they lack a synergistic optimization of the hardware architecture and diverse dataflows for the complete CNN design, which can provide a higher potential for performance/energy efficiency. Towards this, we propose a novel Massively-Parallel Neural Array (MPNA) accelerator that integrates two heterogeneous systolic arrays and respective highly-optimized dataflow patterns to jointly accelerate both the convolutional (CONV) and the fully-connected (FC) layers. Besides fully-exploiting the available off-chip memory bandwidth, these optimized dataflows enable high data-reuse of all the data types (i.e., weights, input and output activations), and thereby enable our MPNA to achieve high energy savings. We synthesized our MPNA architecture using the ASIC design flow for a 28nm technology, and performed functional and timing validation using multiple real-world complex CNNs. MPNA achieves 149.7GOPS/W at 280MHz and consumes 239mW. Experimental results show that our MPNA architecture provides 1.7x overall performance improvement compared to state-of-the-art accelerator, and 51% energy saving compared to the baseline architecture.
연구 동기 및 목표
- 기존 CNN 가속기들이 풀연결(FC) 레이어에 대해 최적화하지 못해 성능과 에너지 효율성이 떨어지는 문제를 해결한다.
- 기존 사이클로이드 어레이가 활성화 및 가중치의 재사용이 제한되어 있어 FC 레이어에 대해 최소한의 성능 향상을 제공하는 한계를 극복한다.
- CONV 및 FC 레이어 양쪽에서 데이터 재사용을 극대화하는 하드웨are-소프트웨어 공동 최적화 가속기를 설계한다.
- 다양한 레이어 유형에 적합한 이질적인 사이클로이드 어레이와 전용 데이터플로우 패턴을 통합하여 고성능 및 고에너지 효율을 달성한다.
- 실세계 CNN인 AlexNet 등을 활용한 ASIC 합성과 종합적 평가를 통해 제안된 아키텍처의 효과성을 입증한다.
제안 방법
- CONV 레이어와 FC 레이어 각각에 최적화된 두 종류의 이질적 사이클로이드 어레이를 통합한 새로운 대규모 병렬 신경 어레이(MPNA) 아키텍처를 제안한다.
- 양 레이어 유형에서 가중치, 입력 활성화, 출력 활성화의 재사용을 극대화하는 전용 데이터플로우 패턴을 설계한다.
- 효율적인 데이터 이동과 외부 메모리 액세스 감소를 지원하기 위해 데이터플로우 컨트롤러 및 온칩 메모리 하이어라키(데이터 및 가중치 버퍼 포함)를 구현한다.
- RTL 설계, 합성, 타이밍/에너지/면적 분석를 위한 Synopsys 도구를 활용한 28nm ASIC 설계 프로세스를 이용한다.
- 정확한 온칩 메모리 모델링과 에너지 추정을 위해 CACTI 7.0을 통합한다.
- ModelSim을 사용한 기능 검증 및 타이밍 검증을 수행하고, AlexNet을 포함한 여러 실세계 CNN에서의 성능을 평가한다.
실험 결과
연구 질문
- RQ1동일한 가속기 아키텍처가 에너지 효율성을 희생시키지 않고 CNN의 컨볼루션 및 풀연결 레이어를 효율적으로 가속화할 수 있는가?
- RQ2다양한 레이어 유형 간 가중치, 활성화, 부분합의 재사용을 극대화하기 위해 데이터플로우 최적화를 어떻게 활용할 수 있는가?
- RQ3기존 CONV 최적화 아키텍처에 전용 FC 최적화 사이클로이드 어레이를 추가할 경우 성능 및 에너지 오버헤드는 어느 정도인가?
- RQ4최적화된 데이터플로우로 외부 메모리 액세스를 얼마나 줄일 수 있으며, 이로 인해 CNN 가속기의 전체 에너지 효율성이 얼마나 향상되는가?
- RQ5성능, 에너지 효율성, 면적 소비 측면에서 제안된 MPNA는 최신 기술 대비 어떤가?
주요 결과
- MPNA는 280MHz에서 149.7 GOPS/W의 에너지 효율을 달성하여 기준 아키텍처를 크게 능가한다.
- 제안된 MPNA는 Eyeriss 및 FlexFlow와 같은 최신 기술 대비 전체적으로 1.7배의 성능 향상을 제공한다.
- 최적화된 데이터플로우와 향상된 데이터 재사용 덕분에 FlexFlow 대비 외부 메모리 액세스를 53% 감소시켰다.
- SA-FC 구성 요소는 SA-CONV 대비 면적 오버헤드 2.1%, 전력 오버헤드 4.4%에 그쳐 FC 가속에 대해 매우 낮은 비용을 유발한다.
- 기준 아키텍처 대비 51%의 에너지 절감을 달성하였으며, 이는 주로 메모리 액세스 최소화와 최대한의 데이터 재사용 덕분이었다.
- MPNA의 총 면적은 2.34 mm²이며, 계산부분은 1.38 mm², 온칩 메모리는 0.96 mm²로, 다른 최신 기술 대비 경쟁 가능한 크기이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.