Skip to main content
QUICK REVIEW

[논문 리뷰] Structured Weight Matrices-Based Hardware Accelerators in Deep Neural Networks: FPGAs and ASICs

Caiwen Ding, Ao Ren|arXiv (Cornell University)|2018. 03. 28.
Advanced Neural Network Applications참고 문헌 24인용 수 10
한 줄 요약

이 논문은 블록 순환 행렬 기반의 구조적 가중치 행렬(SWM)을 제안하여, 효율적인 FPGA 및 ASIC 구현을 위한 딥 네ural 네트워크(DNN)의 압축을 수행한다. 계산 복잡도를 O(n²)에서 O(n log n)로, 저장소 복잡도를 O(n²)에서 O(n)으로 감소시킴으로써, 성능은 최대 152배 향상되고 에너지 효율성은 72배 향상되며, LSTM 모델에서는 21배의 속도 향상과 33.5배의 에너지 효율성 향상을 달성한다. 40nm ASIC 설계에서는 8.08×10⁶장의 이미지/줄 에너지 효율성을 입증한다.

ABSTRACT

Both industry and academia have extensively investigated hardware accelerations. In this work, to address the increasing demands in computational capability and memory requirement, we propose structured weight matrices (SWM)-based compression techniques for both \emph{field programmable gate array} (FPGA) and \emph{application-specific integrated circuit} (ASIC) implementations. In algorithm part, SWM-based framework adopts block-circulant matrices to achieve a fine-grained tradeoff between accuracy and compression ratio. The SWM-based technique can reduce computational complexity from O($n^2$) to O($n\log n$) and storage complexity from O($n^2$) to O($n$) for each layer and both training and inference phases. For FPGA implementations on deep convolutional neural networks (DCNNs), we achieve at least 152X and 72X improvement in performance and energy efficiency, respectively using the SWM-based framework, compared with the baseline of IBM TrueNorth processor under same accuracy constraints using the data set of MNIST, SVHN, and CIFAR-10. For FPGA implementations on long short term memory (LSTM) networks, the proposed SWM-based LSTM can achieve up to 21X enhancement in performance and 33.5X gains in energy efficiency compared with the baseline accelerator. For ASIC implementations, the SWM-based ASIC design exhibits impressive advantages in terms of power, throughput, and energy efficiency. Experimental results indicate that this method is greatly suitable for applying DNNs onto both FPGAs and mobile/IoT devices.

연구 동기 및 목표

  • 자원 제약 환경에서 대규모 딥 네ural 네트워크(DNN)의 증가하는 계산 및 메모리 요구량을 해결한다.
  • 희소성 및 낮은 질서 근사와 같은 기존 모델 압축 기법의 한계를 극복한다. 이러한 기법들은 비정규성과 증가된 학습 복잡도를 유도한다.
  • 모바일 및 IoT 기기용 FPGA 및 ASIC에서 고성능, 고에너지 효율성 DNN 추론을 가능하게 한다.
  • 구조적 가중치 행렬 설계를 통해 모델 정확도와 압축 비율 사이의 미세한 트레이드오프를 달성한다.
  • 완전 연결층과 컨볼루션층 모두에 적용 가능한 수학적으로 엄밀한 프레임워크를 개발한다.

제안 방법

  • DNN 레이어의 밀도 가중치 행렬을 대체하기 위해 블록 순환 행렬을 구조적 가중치 행렬(SWM)로 활용한다.
  • 빠른 푸리에 변환(FFT)을 활용하여 행렬-벡터 곱셈을 효율적으로 수행함으로써, 복잡도를 O(n²)에서 O(n log n)로 감소시킨다.
  • 완전 연결 및 컨볼루션 레이어에 가중치 행렬 변환 기법을 적용하여, 모델 정확도를 유지하면서도 압축을 가능하게 한다.
  • ASIC 설계에서 64점 FFT 모듈을 사용하여 64요소 벡터를 처리함으로써, 구조적 행렬의 효율적 계산을 지원한다.
  • 엔드 투 엔드 평가를 위해 FPGA(XCKU060, Virtex-7) 및 ASIC(SMIC 40nm) 플랫폼 모두에 SWM 기반 설계를 구현한다.
  • 정확도 유지의 목적으로 출력 레이어의 원래 가중치 구조를 유지하면서, 모든 이전 레이어를 블록 순환 형태로 변환한다.

실험 결과

연구 질문

  • RQ1블록 순환 행렬 기반의 구조적 가중치 행렬(SWM)은 DNN에서 높은 압축 비율을 달성하면서도 높은 모델 정확도를 유지할 수 있는가?
  • RQ2SWM 기반 설계는 완전 연결 및 컨볼루션 레이어에서 계산 및 저장 복잡도를 얼마나 줄일 수 있는가?
  • RQ3SWM 기반 가속기의 성능과 에너지 효율성은 IBM TrueNorth 및 ESE와 같은 최첨단 기준 대비 FPGA 플랫폼에서 어떻게 나타나는가?
  • RQ4SWM 기반 설계는 모바일 및 IoT 애플리케이션을 위한 ASIC 구현에서 성능 및 에너지 효율성 향상에 기여하는가?
  • RQ5SWM 프레임워크는 정확도 저하를 최소화하면서도 CNN과 RNN(LSTM 등)에 효과적으로 적용될 수 있는가?

주요 결과

  • FPGA 플랫폼에서 SWM 기반 프레임워크는 MNIST, SVHN, CIFAR-10 데이터셋에서 IBM TrueNorth 대비 최소 152배 높은 성능과 72배 높은 에너지 효율성을 확보한다. 이는 유사한 정확도 제약 조건 하에서 성취된 것이다.
  • LSTM 네트워크에서는 AMD-7v3 FPGA에서 ESE 가속기 대비 최대 21배의 속도 향상과 33.5배의 에너지 효율성 향상을 달성한다.
  • SMIC 40nm 기술을 사용한 ASIC 구현은 1.14×10⁶장의 이미지/초의 처리량, 0.14W의 전력 소모, 8.08×10⁶장의 이미지/J의 에너지 효율성을 달성한다.
  • SWM 기반 설계는 LSTM2(블록 크기 8)에서 상대적 PER 저하 0.32% 이내, LSTM1(블록 크기 16)에서 1.23% 이내로 높은 정확도를 유지한다.
  • 이 방법은 각 레이어당 저장소 복잡도를 O(n²)에서 O(n)으로, 계산 복잡도를 O(n²)에서 O(n log n)으로 감소시켜 엣지 디바이스에서의 확장 가능한 구현을 가능하게 한다.
  • 에너지 효율성 향상은 성능 향상보다 더 높은 편이었는데, 이는 전력 소모 감소 덕분이었다. 특히 XCKU060 FPGA는 28nm Virtex-7보다 더 고급 20nm 공정을 사용하고 있기에 두드러진 특징이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.