Skip to main content
QUICK REVIEW

[논문 리뷰] A SOT-MRAM-based Processing-In-Memory Engine for Highly Compressed DNN Implementation

Geng Yuan, Xiaolong Ma|arXiv (Cornell University)|2019. 11. 24.
Advanced Neural Network Applications참고 문헌 34인용 수 9
한 줄 요약

이 논문은 SOT-MRAM 기반의 프로세싱-인-메모리(PIM) 엔진을 위한 ADMM 기반 모델 압축 프레임워크를 제안하여 고도로 압축되고 에너지 효율적인 DNN 추론을 가능하게 한다. 훈련 중에 구조적 가중치 프루닝과 저비트 양자화를 동시에 적용함으로써 ADMM를 사용하여 SOT-MRAM의 면적과 전력 소비를 줄이고, 높은 정확도를 유지하면서 처리량을 향상시킨다. 이로써 MNIST에서 최대 81.3×의 압축률을 달성하면서 정확도 손실를 최소화한다.

ABSTRACT

The computing wall and data movement challenges of deep neural networks (DNNs) have exposed the limitations of conventional CMOS-based DNN accelerators. Furthermore, the deep structure and large model size will make DNNs prohibitive to embedded systems and IoT devices, where low power consumption are required. To address these challenges, spin orbit torque magnetic random-access memory (SOT-MRAM) and SOT-MRAM based Processing-In-Memory (PIM) engines have been used to reduce the power consumption of DNNs since SOT-MRAM has the characteristic of near-zero standby power, high density, none-volatile. However, the drawbacks of SOT-MRAM based PIM engines such as high writing latency and requiring low bit-width data decrease its popularity as a favorable energy efficient DNN accelerator. To mitigate these drawbacks, we propose an ultra energy efficient framework by using model compression techniques including weight pruning and quantization from the software level considering the architecture of SOT-MRAM PIM. And we incorporate the alternating direction method of multipliers (ADMM) into the training phase to further guarantee the solution feasibility and satisfy SOT-MRAM hardware constraints. Thus, the footprint and power consumption of SOT-MRAM PIM can be reduced, while increasing the overall system throughput at the meantime, making our proposed ADMM-based SOT-MRAM PIM more energy efficiency and suitable for embedded systems or IoT devices. Our experimental results show the accuracy and compression rate of our proposed framework is consistently outperforming the reference works, while the efficiency (area \& power) and throughput of SOT-MRAM PIM engine is significantly improved.

연구 동기 및 목표

  • 대규모 DNN을 임베디드 및 IoT 시스템에 구현할 때의 에너지 및 하드웨어 제약를 해결한다.
  • SOT-MRAM PIM의 한계, 예를 들어 높은 쓰기 지연과 낮은 비트 폭 지원을 소프트웨어 수준의 모델 압축을 통해 극복한다.
  • 구조적 프루닝과 저비트 양자화를 통합한 통합 프레임워크를 개발하여 SOT-MRAM 하드웨어 제약에 부합하도록 한다.
  • ADMM를 훈련 단계에 통합하여, 압축 및 하드웨어 매핑 이후에도 높은 모델 정확도와 해법의 타당성을 확보한다.
  • 최적화된 모델 압축을 통해 SOT-MRAM PIM 엔진의 처리량을 향상시키고 전력/면적 소비를 감소시킨다.

제안 방법

  • 구조적 희박성과 저비트 표현을 반복적이고 분석적으로 해결할 수 있도록, 분할 최적화 기법인 교대 방향 승수법(ADMM)을 사용하여 가중치 프루닝과 양자화 문제를 최적화 문제로 수식화한다.
  • 하드웨어 효율을 극대화하고 불필요한 계산을 최소화하기 위해 필터, 채널, 커널 프루닝을 모두 포함한 복합 프루닝 기법을 적용한다.
  • SOT-MRAM PIM의 비트 병렬 처리 아키텍처와 자연스럽게 일치하는 작은 규칙적인 공간 패턴을 가진 구조적 프루닝 모델을 설계하여 메모리 내 계산의 효율성을 높인다.
  • 압축된 DNN 모델을 SOT-MRAM PIM 엔진에 매핑하여 AND, 비트 카운팅, 비트 시프트 연산을 사용해 비트 단위의 컨볼루션을 수행함으로써 높은 에너지 효율성을 확보한다.
  • 면적과 전력 소비를 추가로 줄이기 위해 실험에서 8비트 양자화를 사용한다.
  • 버퍼 및 인터코ネ크 모델링을 위해 Cacti 7을 활용하고, 메모리 서브어레이의 에너지/면적 추정을 위해 수정된 SOT-MRAM 파rameters를 적용한 NVSim을 사용하며, 외부 ADC의 전력/면적 데이터를 별도로 활용한다.

실험 결과

연구 질문

  • RQ1ADMM를 통한 공동 구조적 프루닝과 저비트 양자화는 SOT-MRAM PIM 아키텍처에서 높은 압축률을 달성하면서도 DNN 정확도를 유지할 수 있는가?
  • RQ2기본 프루닝이나 이진화와 비교했을 때, ADMM 기반의 압축은 SOT-MRAM PIM의 해법 타당성과 하드웨어 호환성에 어떤 영향을 미치는가?
  • RQ3모델 압축은 시스템 처리량을 저하시키지 않으면서 SOT-MRAM PIM 엔진의 면적과 전력 소비를 얼마나 줄일 수 있는가?
  • RQ4SOT-MRAM PIM 시스템에서 필터, 채널, 커널 프루닝과 같은 다양한 프루닝 유형을 적용할 경우, 압축률, 정확도, 하드웨어 효율성 간의 상호 상충 관계는 어떠한가?
  • RQ5기본 벤치마크에서 최신 기술 대비 제안된 프레임워크는 압축률, 정확도, 에너지 효율성 측면에서 어떤 성능을 보이는가?

주요 결과

  • 제안된 프레임워크는 MNIST의 LeNet-5에서 81.3×의 압축률을 달성했으며, 정확도 저하율은 0.02%에 불과했고, Group Scissor 대비 19.4× 높은 압축률을 기록했다.
  • CIFAR-10에서 프레임워크는 ResNet-18과 VGG-16에 대해 각각 59.8×와 44.8×의 압축률을 기록했으며, 기준 방법 대비 최소한의 정확도 손실을 보였다.
  • ImageNet에서는 AlexNet, ResNet-18, VGG-16에 대해 각각 5.2×, 3.0×, 2.7×의 압축률을 달성했고, 기준 모델과 비교해 상위-1 정확도 손실이 1% 이내로 유지되었다.
  • 채널 프루닝이 전체 처리 요소와 그 주변 회로를 제거함으로써 전력 및 면적 감소에 가장 기여했다.
  • 필터 및 커널 프루닝은 SOT-MRAM 서브어레이 전반의 계산 반복 수를 줄여 시스템 처리량을 향상시켰다.
  • SOT-MRAM PIM 엔진의 전력 및 면적 소비는 크게 감소했고, 압축되지 않은 설계 대비 전체 시스템 처리량이 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.