[논문 리뷰] NESTA: Hamming Weight Compression-Based Neural Proc. Engine
NESTA는 3×3 커널의 9개 입력 값을 동시에 처리할 수 있도록 하드웨어를 최적화한 전용 신경망 처리 엔진으로, 기존의 승산누적(MAC) 유닛을 대체하기 위해 해밍 무게 압축기의 계층적 구조를 도입한다. 부분합의 근사 계산을 수행하고 잔여 캐리 보정을 최종 사이클로 연기함으로써 임계 경로 지연을 감소시키며, MAC 기반 가속기 대비 33–78% 낮은 파워-디레이 제품(PDP)을 달성한다.
In this paper, we present NESTA, a specialized Neural engine that significantly accelerates the computation of convolution layers in a deep convolutional neural network, while reducing the computational energy. NESTA reformats Convolutions into $3 imes 3$ batches and uses a hierarchy of Hamming Weight Compressors to process each batch. Besides, when processing the convolution across multiple channels, NESTA, rather than computing the precise result of a convolution per channel, quickly computes an approximation of its partial sum, and a residual value such that if added to the approximate partial sum, generates the accurate output. Then, instead of immediately adding the residual, it uses (consumes) the residual when processing the next batch in the hamming weight compressors with available capacity. This mechanism shortens the critical path by avoiding the need to propagate carry signals during each round of computation and speeds up the convolution of each channel. In the last stage of computation, when the partial sum of the last channel is computed, NESTA terminates by adding the residual bits to the approximate output to generate a correct result.
연구 동기 및 목표
- 기존의 MAC 기반 DNN 가속기들이 CNN 컨볼루션 레이어를 처리할 때 발생하는 높은 계산 에너지 소비와 지연 문제를 해결하기 위해.
- 각 사이클에 9개의 값을 (3×3 커널 기준) 배치화된 방식으로 압축하여 처리함으로써 데이터 이동과 부분합 생성을 줄이기 위해.
- 시간적 캐리 비트와 계층적 압축기를 활용해 캐리 전파를 연기함으로써 에너지 효율성과 처리량을 향상시키기 위해.
- 기존의 MAC 기반 및 MAC9 기반 신경처리 유닛보다 높은 성능과 낮은 PDP를 달성하기 위해.
제안 방법
- NESTA는 3×3 컨볼루션을 배치 단위로 재구성하고, 해밍 무게 압축기의 계층적 구조를 사용하여 근사 부분합과 잔여 캐리 비트를 동시에 계산한다.
- 각 사이클에서 근사 합(S′)과 시간적 캐리(P)를 계산하며, 최종 보정은 마지막 사이클로 연기한다.
- 기본적인 캐리 전파를 피하고, 여유 용량이 있는 후속 압축기에서 잔여 비트를 소비함으로써 임계 경로를 단축시킨다.
- 최종적으로 잔여 캐리 비트를 근사 합에 더하는 최종 덧셈 단계를 통해 출력을 생성한다.
- 다중화기와 전통적인 가산기를 피하고, 압축과 하나의 최종 덧셈만을 활용하여 정확한 결과를 도출한다.
- NESTA는 AlexNet과 VGG를 대상으로 후기판 설계 시뮬레이션을 수행하여, 다양한 MAC 및 MAC9 구성 대비 처리량, 지연, PDP를 비교 분석한다.
실험 결과
연구 질문
- RQ1압축 기반 처리 엔진이 CNN 추론에서 에너지 효율성과 처리량 측면에서 기존의 MAC 유닛을 능가할 수 있는가?
- RQ2시간적 캐리 비트를 활용해 캐리 전파를 연기할 경우, 컨볼루션 계산의 임계 경로와 전체 지연에 어떤 영향을 미치는가?
- RQ3잔여 보정을 동반한 근사 부분합 계산이 DNN 가속기의 파워-디레이 제품(PDP)을 얼마나 줄일 수 있는가?
- RQ49개의 입력 값(3×3 커널 기준)을 계층적으로 압축함으로써 표준 MAC 유닛 대비 면적, 전력, 성능에 어떤 영향을 미치는가?
주요 결과
- 후기판 설계 시뮬레이션 결과, NESTA는 다양한 9입력 MAC 유닛 대비 30–67% 낮은 파워-디레이 제품(PDP)을 달성한다.
- 최고 및 최악의 성능을 보인 MAC 기반 설계 대비 NESTA의 에너지 효율성은 33–78% 향상되고, 처리량은 1–37% 향상된다.
- 시간적 캐리 비트 사용과 보류 보정 기법 덕분에 캐리 전파를 각 계산 사이클에 걸쳐 방지함으로써 임계 경로 지연이 감소한다.
- AlexNet과 VGG의 모든 레이어에서 NESTA는 MAC9 및 개별 MAC 유닛 모두보다 지연과 에너지 소비 측면에서 뛰어난 성능을 보인다.
- 최종 잔여 보정을 통해 정확도를 유지하면서도, 가장 열악한 성능을 보인 MAC 구성 대비 PDP를 최대 78%까지 감소시킨다.
- 9입력 압축 모델과 함께 계층적 해밍 무게 압축기를 활용한 본 설계는 결과 정확도를 훼손하지 않으면서도 면적과 에너지 소비를 크게 절감할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.