Skip to main content
QUICK REVIEW

[논문 리뷰] AnalogNets: ML-HW Co-Design of Noise-robust TinyML Models and Always-On Analog Compute-in-Memory Accelerator

Chuteng Zhou, Fernando Garćıa-Redondo|arXiv (Cornell University)|2021. 11. 10.
Advanced Memory and Neural Computing참고 문헌 45인용 수 8
한 줄 요약

AnalogNets는 잡음에 강건한 신경망 아키텍처와 상시 작동하는 메모리 내 계산(CiM) 가속기인 프래그먼트 메모리(PCM) 기반 아날로그 CiM 가속기를 공동 설계한 티니ML 프레임워크를 제안한다. 이 방법은 키워드 스폴링과 시각적 깨어남 신호 감지 작업에서 각각 8.58 TOPS/W 및 4.37 TOPS/W의 에너지 효율성을 달성했으며, PCM의 도전성 변화로 인한 24시간 후에도 정확도 저하가 각각 0.8%와 1.2%에 불과하여 실제 하드웨어에서 높은 에너지 효율성과 강건성을 입증한다.

ABSTRACT

Always-on TinyML perception tasks in IoT applications require very high energy efficiency. Analog compute-in-memory (CiM) using non-volatile memory (NVM) promises high efficiency and also provides self-contained on-chip model storage. However, analog CiM introduces new practical considerations, including conductance drift, read/write noise, fixed analog-to-digital (ADC) converter gain, etc. These additional constraints must be addressed to achieve models that can be deployed on analog CiM with acceptable accuracy loss. This work describes $ extit{AnalogNets}$: TinyML models for the popular always-on applications of keyword spotting (KWS) and visual wake words (VWW). The model architectures are specifically designed for analog CiM, and we detail a comprehensive training methodology, to retain accuracy in the face of analog non-idealities, and low-precision data converters at inference time. We also describe AON-CiM, a programmable, minimal-area phase-change memory (PCM) analog CiM accelerator, with a novel layer-serial approach to remove the cost of complex interconnects associated with a fully-pipelined design. We evaluate the AnalogNets on a calibrated simulator, as well as real hardware, and find that accuracy degradation is limited to 0.8$\%$/1.2$\%$ after 24 hours of PCM drift (8-bit) for KWS/VWW. AnalogNets running on the 14nm AON-CiM accelerator demonstrate 8.58/4.37 TOPS/W for KWS/VWW workloads using 8-bit activations, respectively, and increasing to 57.39/25.69 TOPS/W with $4$-bit activations.

연구 동기 및 목표

  • 비이상적인 특성(예: 도전성 변화, ADC 노이즈 등)을 가진 아날로그 메모리 내 계산(CiM) 하드웨어에서 정확하고 저전력의 티니ML 모델을 구현하는 데 도전하는 것.
  • 아날로그 CiM 하드웨어에 특화된 신경망 아키텍처와 하드웨어 가속기를 공동 설계하여 아날로그 비이상성과 저해상도 정밀도 양자화에 강건성을 확보하는 것.
  • 인터커넥트 복잡성을 줄이기 위해 층 순차 실행 모델을 채택한 최소 면적의 프ogram 가능 PCM 기반 CiM 가속기(AON-CiM)를 개발하는 것.
  • 특히 상시 작동 IoT 응용 분야를 고려해 실제 아날로그 하드웨어 제약 조건 하에서 높은 에너지 효율성과 최소한의 정확도 저하를 달성하는 것.
  • 체계적인 ML-HW 공동 설계가 아날로그 CiM에서 부동소수점에 가까운 정확도를 달성하고, MCU 기반 솔루션 대비 수개의 주기 차수만큼 더 뛰어난 에너지 효율성을 확보할 수 있음을 입증하는 것.

제안 방법

  • 키워드 스폴링(KWS)과 시각적 깨어남 신호 감지(VWW) 작업에 특화된, 아날로그 CiM 하드웨어를 고려해 최적화된 커스터마이징된 티니ML 모델 아키텍처인 AnalogNets를 제안한다.
  • 역전파 과정 동안 시뮬레이션된 아날로그 비이상성(도전성 변화, 읽기/쓰기 노이즈, 저해상도 ADC 등)을 통합한 종합적인 훈련 방법을 적용하여 강건성을 향상시킨다.
  • 완전한 파이프라인 설계에서 복잡한 인터커넥트를 제거하기 위해 새로운 층 순차 실행 모델을 채택한 14nm CMOS 기반의 프래그먼트 메모리(PCM) 기반 CiM 하드웨어인 AON-CiM 가속기를 도입한다.
  • 면적과 전력 소모를 최소화하기 위해 PWM 기반 DAC와 저비트 폭 ADC를 사용하며, 활성화 정밀도를 8비트, 6비트, 4비트로 조정해 성능을 스케일링한다.
  • 정확도와 에너지 효율성을 실제 아날로그 조건에서 검증하기 위해 교정된 시뮬레이터와 실제 PCM 테스트 칩을 활용한다.
  • 칩 내 NVM 제약과 저정밀도 계산 환경에 맞게 모델 압축 기법(예: 프루닝, 가중치 공유 포함)과 극한의 양자화를 적용한다.

실험 결과

연구 질문

  • RQ1어떻게 아날로그 CiM 하드웨어와 함께 티니ML 모델을 공동 설계하여 도전성 변화와 아날로그 노이즈에도 높은 정확도를 유지할 수 있는가?
  • RQ2실시간 티니ML 추론 작업을 위한 완전히 칩 내부에 구현된 상시 작동 아날로그 CiM 가속기의 실현 가능한 에너지 효율성은 어느 정도인가?
  • RQ3아날로그 CiM에서 층 순차 실행 모델이 스케줄링 복잡성과 성능 저하 없이 하드웨어 면적과 복잡성을 줄일 수 있는가?
  • RQ4극한의 양자화(활성화 정밀도 4비트 이하)가 아날로그 비이상성과 저정밀도 ADC와 결합되었을 때 모델 정확도에 어떤 영향을 미치는가?
  • RQ5체계적인 ML-HW 공동 설계가 상시 작동 티니ML 응용 분야에서 디지털 기반 기준과 아날로그 CiM 배포 간의 정확도 격차를 어느 정도 메울 수 있는가?

주요 결과

  • 24시간 동안 PCM 도전성 변화가 발생한 후에도 AnalogNets는 KWS 작업에서 95.6%의 정확도, VWW 작업에서 85.7%의 정확도를 달성했으며, 각각 0.8%와 1.2%의 정확도 저하만 기록했다.
  • AON-CiM 가속기는 8비트 활성화 정밀도에서 KWS와 VWW 작업에 대해 각각 8.58 TOPS/W 및 4.37 TOPS/W의 성능을 달성했으며, 4비트 정밀도에서는 각각 57.39 TOPS/W 및 25.69 TOPS/W로 증가했다.
  • 처리량은 층 크기와 종횡비에 따라 스케일링되며, 더 크고 더 높은 층은 DAC/ADC 에너지 비용을 분산시켜 더 높은 TOPS/W 성능을 달성한다.
  • 층 순차 설계로 복잡한 인터커넥트를 제거함으로써 면적을 감소시켜 총 칩 면적 3.2mm²를 달성했으며, 그 중 3.07mm²는 CiM 어레이에 할당되었다.
  • MCU 기반 티니ML 대비 에너지 효율성이 4개 주기 차수 향상되었으며, KWS 작업에서 AON-CiM는 8.2 μJ/추론, MCU는 48.6 mJ/추론를 기록했다.
  • 결과적으로 체계적인 ML-HW 공동 설계가 아날로그 CiM 하드웨어에서 이상적인 모델 정확도를 거의 달성할 수 있음을 입증하였으며, 이는 에너지 제약이 심한 상시 작동 IoT 응용 분야에 실현 가능함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.