Skip to main content
QUICK REVIEW

[논문 리뷰] An Ultra-Efficient Memristor-Based DNN Framework with Structured Weight Pruning and Quantization Using ADMM

Geng Yuan, Xiaolong Ma|arXiv (Cornell University)|2019. 08. 29.
Advanced Memory and Neural Computing참고 문헌 35인용 수 7
한 줄 요약

이 논문은 초저전력 및 초소형 면적 효율성을 달성하기 위해 ADMM를 사용하여 구조적 가중치 프루닝과 양자화를 동시에 최적화하는 통합 메모리스터 기반 DNN 프레임워크를 제안한다. VGG-16에서 최대 29.81배의 가중치 압축을 달성하면서 정확도 손실이 0.5%에 불과하고, 전력 소모 98.38%, 면적 98.29% 감소를 이룬다. 이는 도전적일 수 있는 전도도 범위 및 장치 불일치와 같은 하드웨어 제약 조건을 고려한 결과이다.

ABSTRACT

The high computation and memory storage of large deep neural networks (DNNs) models pose intensive challenges to the conventional Von-Neumann architecture, incurring substantial data movements in the memory hierarchy. The memristor crossbar array has emerged as a promising solution to mitigate the challenges and enable low-power acceleration of DNNs. Memristor-based weight pruning and weight quantization have been seperately investigated and proven effectiveness in reducing area and power consumption compared to the original DNN model. However, there has been no systematic investigation of memristor-based neuromorphic computing (NC) systems considering both weight pruning and weight quantization. In this paper, we propose an unified and systematic memristor-based framework considering both structured weight pruning and weight quantization by incorporating alternating direction method of multipliers (ADMM) into DNNs training. We consider hardware constraints such as crossbar blocks pruning, conductance range, and mismatch between weight value and real devices, to achieve high accuracy and low power and small area footprint. Our framework is mainly integrated by three steps, i.e., memristor-based ADMM regularized optimization, masked mapping and retraining. Experimental results show that our proposed framework achieves 29.81X (20.88X) weight compression ratio, with 98.38% (96.96%) and 98.29% (97.47%) power and area reduction on VGG-16 (ResNet-18) network where only have 0.5% (0.76%) accuracy loss, compared to the original DNN models. We share our models at link http://bit.ly/2Jp5LHJ.

연구 동기 및 목표

  • 기존 바르나우스 구조의 DNN 아키텍처에서 증가하는 계산 및 메모리 요구량을 해결하기 위해.
  • 메모리스터 기반 뉴로모픽 컴퓨팅의 하드웨어 한계(예: 불균형한 워크로드, 비정규적 메모리 액세스, 장치의 비완전성 등)를 극복하기 위해.
  • 메모리스터 기반 DNN에서 구조적 가중치 프루닝과 가중치 양자화를 체계적으로 통합하여 압축률과 에너지 효율을 극대화하기 위해.
  • 실제 메모리스터 제약 조건을 학습 과정에 통합하여 높은 모델 정확도와 하드웨어 타당성을 확보하기 위해.
  • ADMM를 통해 프루닝과 양자화를 동시에 최적화하는 통합 프레임워크를 개발하여 정확도 저하를 최소화하고 하드웨어 효율을 극대화하기 위해.

제안 방법

  • ADMM를 적용하여 DNN 학습 중에 구조적 가중치 프루닝과 양자화를 동시에 최적화함으로써 하드웨어 제약 조건 하에서 종단 간 최적화를 가능하게 한다.
  • 크로스바 블록 프루닝, 전도도 범위 제한, 장치 불일치 등 하드웨어 특화 제약 조건을 ADMM 정규화 최적화 과정에 통합한다.
  • 구조적 희소성 강제 및 메모리스터 크로스바 어레이 아키텍처와의 호환성을 확보하기 위해 마스크 매핑을 사용한다.
  • 프루닝 및 양자화 후 재학습을 수행하여 하드웨어 제약 조건 하에서 정확도를 복구하고 모델 성능을 개선한다.
  • 영점 대칭이면서 잘 수준 조절된 양자화 수준을 설계하여 가중치를 영점에 매핑하는 것을 방지함으로써 양자화 오차를 감소시키고 하드웨어 매핑 정밀도를 향상시킨다.
  • 메모리스터의 비완전성(예: 상태 드리프트, 공정 변동성 등)의 영향을 양자화 과정에 모델링하여 정확도 및 내성 향상에 기여한다.

실험 결과

연구 질문

  • RQ1메모리스터 기반 DNN 프레임워크에서 구조적 가중치 프루닝과 가중치 양자화를 동시에 최적화하여 더 높은 압축률과 낮은 전력 소모를 달성할 수 있는가?
  • RQ2실제 메모리스터 하드웨어 제약 조건 하에서 ADMM 기반 최적화가 프루닝과 양자화를 통합할 경우 정확도 및 타당성은 어떻게 향상되는가?
  • RQ3VGG-16 및 ResNet-18와 같은 깊은 신경망에 대해 통합 프루닝과 양자화를 적용할 때, 압축 비율, 전력/면적 감소, 정확도 손실 간의 상호 교환 관계는 어떠한가?
  • RQ4하드웨어 인식 양자화가 전도도 불일치 및 상태 드리프트와 같은 메모리스터 비완전성의 영향을 어느 정도 완화할 수 있는가?
  • RQ5압축 비율, 정확도, 에너지 효율성 측면에서 기존 방법(예: Group Scissor)에 비해 제안된 프레임워크는 어떻게 비교되는가?

주요 결과

  • 제안된 프레임워크는 VGG-16에서 29.81×(ResNet-18에서는 20.88×)의 가중치 압축 비율을 달성하였고, 원본 모델 대비 정확도 손실은 각각 0.5%(0.76%)에 불과하다.
  • 5비트 양자화 조건 하에서 VGG-16에서는 전력 소모 98.38%, 면적 98.29% 감소를 달성하였고, ResNet-18에서는 전력 96.96%, 면적 97.47% 감소를 기록하였다.
  • LeNet-5 및 ConvNet에서 프레임워크는 정확도 및 압축 비율 측면에서 Group Scissor를 초월하여, 6비트 양자화 조건에서 17.69×의 압축 비율을 달성하면서 정확도 손실은 0.1%에 머물렀다.
  • CIFAR-10에서 VGG-16 및 ResNet-18와 같은 깊은 네트워크는 고압축 조건에서도 거의 이상적인 정확도를 유지하였으며, 각각 29.81× 및 20.88×의 압축 비율에서 정확도 손실이 0.8% 및 0.6%에 불과했다.
  • 5비트 양자화가 모든 테스트 네트워크에서 가장 큰 전력 및 면적 감소를 이끌어내었으며, 최대 98.38% 전력 감소 및 98.29% 면적 감소를 기록하였다.
  • 양자화 과정에서 영점 매핑을 피하고 장치 수준의 비완전성을 최적화 과정에 통합함으로써 프레임워크는 높은 정확도와 하드웨어 타당성을 유지하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.