[논문 리뷰] Tiny but Accurate: A Pruned, Quantized and Optimized Memristor Crossbar Framework for Ultra Efficient DNN Implementation
이 논문은 ADMM 기반의 구조적 가중치 프루닝과 8비트 양자화를 조합하여 메모리스터 크로스바에서 초효율적인 DNN 추론을 위한 통합 소프트웨어-하드웨어 공동 최적화 프레임워크를 제안한다. 프루닝 이후 잔류하는 불필요한 가중치와 비활성 연결을 제거하기 위해 네트워크 정제와 미사용 경로 제거 기법을 도입하여, VGG-16에서 최대 50.02× 압축을 달성했으며 정확도 손실이 거의 없고, VGG-16에서 44.67× 압축을 달성했을 때 정확도 저하가 0.63%에 불과하며, 높은 에너지 효율성과 하드웨어 구현 가능성을 유지한다.
The state-of-art DNN structures involve intensive computation and high memory storage. To mitigate the challenges, the memristor crossbar array has emerged as an intrinsically suitable matrix computation and low-power acceleration framework for DNN applications. However, the high accuracy solution for extreme model compression on memristor crossbar array architecture is still waiting for unraveling. In this paper, we propose a memristor-based DNN framework which combines both structured weight pruning and quantization by incorporating alternating direction method of multipliers (ADMM) algorithm for better pruning and quantization performance. We also discover the non-optimality of the ADMM solution in weight pruning and the unused data path in a structured pruned model. Motivated by these discoveries, we design a software-hardware co-optimization framework which contains the first proposed Network Purification and Unused Path Removal algorithms targeting on post-processing a structured pruned model after ADMM steps. By taking memristor hardware constraints into our whole framework, we achieve extreme high compression ratio on the state-of-art neural network structures with minimum accuracy loss. For quantizing structured pruned model, our framework achieves nearly no accuracy loss after quantizing weights to 8-bit memristor weight representation. We share our models at anonymous link https://bit.ly/2VnMUy0.
연구 동기 및 목표
- 에너지 효율적인 뉴로모픽 컴퓨팅을 위한 초고압축 DNN 도전 과제를 해결하기 위해.
- ADMM 기반의 구조적 프루닝이 남기는 잔여 가중치와 미사용 경로의 한계를 극복하기 위해.
- 실현 가능하고 고압축 DNN 배포를 위한 메모리스터 하드웨어 제약을 고려한 공동 최적화 프레임워크를 설계하기 위해.
- 압축된 모델에 대해 8비트 양자화를 통해 하드웨어 프로파일을 감소시키고 에너지 효율성을 향상시키기 위해 근사 손실 없는 정확도를 달성하기 위해.
- 표준 벤치마크에서 기존 방법인 Group Scissor와 SSL에 비해 더 높은 압축 비율과 정확도 유지 성능을 확보하기 위해.
제안 방법
- 비볼록 구조적 프루닝 문제를 해결하기 위해 ADMM를 활용하여 DNN 가중치의 희박성 패턴을 효율적으로 최적화한다.
- 메모리스터 인식 양자화를 적용하여 8비트 가중치를 4비트 메모리스터 상태로 매핑하고, 각 가중치당 2개의 장치를 사용하여 하드웨어 오버헤드를 감소시킨다.
- ADMM 프루닝 이후 잔류하는 불필요한 가중치를 제거하기 위해 네트워크 정제 기법을 도입하여 모델 효율성을 향상시킨다.
- 구조적 프루닝된 모델에서 비활성 연결을 제거하기 위해 미사용 경로 제거 기법을 제안하여 추가로 하드웨어 프로파일을 감소시킨다.
- 정밀도를 유지하기 위해 전체 정밀도 소프트웨어 모델에서의 지식 증류를 활용하여 양자화를 지도한다.
- 영역과 전력 소모 추정을 위해 MATLAB 및 NVSim 시뮬레이션을 사용하여 프레임워크를 검증하였으며, H-트리 루팅 및 45nm CMOS 주변 회로를 적용하였다.
실험 결과
연구 질문
- RQ1ADMM 기반의 구조적 프루닝과 8비트 양자화를 조합하여 메모리스터 크로스바에서 극한의 압축을 달성하면서 정확도 손실을 최소화할 수 있는가?
- RQ2ADMM 최적화된 구조적 프루닝 모델에서 잔여 가중치와 미사용 경로가 어느 정도 남아 있으며, 이를 체계적으로 제거할 수 있는가?
- RQ3제안된 소프트웨어-하드웨어 공동 최적화 프레임워크는 기존 방법 대비 압축 비율과 에너지 효율성에서 어떻게 향상되는가?
- RQ4메모리스터 하드웨어 제약(예: 4비트 정밀도, 1R 크로스바)은 모델 압축과 정확도에 어떤 영향을 미치는가?
- RQ5심층 네트워크인 VGG-16과 ResNet-18에 대해, 프루닝된 모델에 8비트 양자화를 적용한 후에도 높은 정확도를 유지할 수 있는가?
주요 결과
- CIFAR-10에서 VGG-16에 대해 50.02× 압축을 달성했으며 정확도 저하가 0.63%에 불과하고, 8비트 양자화 후 정확도 손실이 없었다.
- CIFAR-10에서 ResNet-18에 대해 59.84× 압축을 달성했으며, 양자화 후 정확도 손실이 없었다.
- ImageNet에서 ResNet-18에 대해 3.33× 압축을 달성했고, 상위-1 정확도가 88.36%였으며, ResNet-50에 대해선 2.70× 압축을 달성했고 정확도가 92.27%였다.
- P-RM 공동 최적화로 5.83× 압축된 ResNet-18 모델의 면적과 전력 소모가 각각 0.235 mm²에서 0.042 mm², 3.359 W에서 0.585 W로 감소했으며 정확도 손실이 없었다.
- VGG-16에서 44.67× 압축을 달성했고 정확도 저하가 0.63%였으며, P-RM를 사용할 경우 50.02× 압축을 달성했을 때도 정확도 저하가 0.63%에 머물렀으며, Group Scissor와 SSL을 초월하는 성능을 보였다.
- LeNet-5를 사용한 MNIST에서는 231.82× 압축을 달성했고 정확도 저하가 0.4%에 불과했으며, 40× 및 88× 압축 비율에서 양자화 후 정확도 손실이 없었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.