Skip to main content
QUICK REVIEW

[논문 리뷰] Online Training of Spiking Recurrent Neural Networks with Phase-Change Memory Synapses

Yiğit Demirağ, Charlotte Frenkel|arXiv (Cornell University)|2021. 08. 04.
Advanced Memory and Neural Computing참고 문헌 70인용 수 12
한 줄 요약

이 논문은 비틀림 메모리(PCM) 시냅스를 사용한 스파iking 순환 신경망(SNNs)을 위한 하드웨어 인식 훈련 프레임워크를 제안한다. 이는 PCM의 비이상적 특성에도 불구하고 기울기 누적을 통해 온라인 훈련을 가능하게 한다. 혼합 정밀도 가중치 업데이트가 저해상도 PCM 장치에서 정밀하고 낮은 학습률의 업데이트를 가능하게 하여 훈련의 안정성과 정확도를 크게 향상시킨다.

ABSTRACT

Spiking recurrent neural networks (RNNs) are a promising tool for solving a wide variety of complex cognitive and motor tasks, due to their rich temporal dynamics and sparse processing. However training spiking RNNs on dedicated neuromorphic hardware is still an open challenge. This is due mainly to the lack of local, hardware-friendly learning mechanisms that can solve the temporal credit assignment problem and ensure stable network dynamics, even when the weight resolution is limited. These challenges are further accentuated, if one resorts to using memristive devices for in-memory computing to resolve the von-Neumann bottleneck problem, at the expense of a substantial increase in variability in both the computation and the working memory of the spiking RNNs. To address these challenges and enable online learning in memristive neuromorphic RNNs, we present a simulation framework of differential-architecture crossbar arrays based on an accurate and comprehensive Phase-Change Memory (PCM) device model. We train a spiking RNN whose weights are emulated in the presented simulation framework, using a recently proposed e-prop learning rule. Although e-prop locally approximates the ideal synaptic updates, it is difficult to implement the updates on the memristive substrate due to substantial PCM non-idealities. We compare several widely adapted weight update schemes that primarily aim to cope with these device non-idealities and demonstrate that accumulating gradients can enable online and efficient training of spiking RNN on memristive substrates.

연구 동기 및 목표

  • 스파iking 순환 신경망(SNNs)을 단단한 프로세서 기반의 PCM 기반 하드웨어에서 온라인, 하드웨어 우호적인 훈련이 가능하도록 하는 것.
  • 사이클 간 변동, $1/f$ 노이즈, 제한된 해상도를 포함한 PCM의 장치 비이상적 특성에 대응하는 것.
  • PCM 비이상적 특성을 완화하는 데 효과적인 가중치 업데이트 방식을 평가하고 비교하는 것.
  • 기울기 누적 기법이 저해상도 PCM 장치에서 높은 정확도를 유지하면서도 효과적인 훈련을 가능하게 함을 보여주는 것.

제안 방법

  • 저자들은 정확한 PCM 장치 모델을 사용한 미분형 아키텍처 크로스바 어레이에 대한 시뮬레이션 프레임워크를 개발하였으며, 이는 확률적 스위칭과 도전성 드리프트를 포함한다.
  • 이들은 이상적 시냅스 업데이트의 국소적, 타임 역행 백프로파게이션 근사치를 계산하기 위해 e-prop 학습 규칙을 사용한다.
  • 가중치 업데이트 방식을 평가하였으며, 직접 e-prop 업데이트, 확률적 반올림, 혼합 정밀도 기울기 누적 방식이 포함된다.
  • 혼합 정밀도 업데이트는 고정밀도 메모리에서 기울기를 누적한 후, PCM 장치에 저정밀도 업데이트를 적용함으로써 프로그래밍 오류를 감소시킨다.
  • 모든 업데이트 방법에 대해 1,000회의 네트워크 시험을 통해 하이퍼파rameter를 베이지안 최적화로 조정하여 공정한 비교를 확보한다.
  • 기준 작업은 100개의 입력, 100개의 순환, 그리고 1개의 출력 LIF 뉴런을 사용하여 1초 동안의 4개의 사인파를 생성하는 것이다.

실험 결과

연구 질문

  • RQ1PCM 기반 뉴로모픽 하드웨어에서 장치의 비이상적 특성에도 불구하고 스파킹 RNN의 온라인 훈련을 신뢰성 있게 달성할 수 있는가?
  • RQ2직접 e-prop, 확률적 반올림, 기울기 누적과 같은 다양한 가중치 업데이트 방식이 실제 PCM 제약 조건 하에서 어떻게 성능을 내는가?
  • RQ3혼합 정밀도 기울기 누적 기법이 저해상도 PCM 장치에서 훈련 수렴과 정확도를 향상시키는가?
  • RQ4사이클 간 변동과 도전성 드리프트와 같은 PCM 고유의 영향이 학습 성능에 얼마나 큰 영향을 미치는가?
  • RQ5기울기 누적 기법이 네트워크 정확도를 유지하면서도 필요한 PCM 프로그래밍 연산 수를 줄일 수 있는가?

주요 결과

  • 혼합 정밀도 기울기 누적 기법은 저해상도 PCM 장치에서 정밀하고 낮은 학습률의 업데이트를 가능하게 하여 모든 테스트된 업데이트 방식 중 가장 높은 정확도를 달성한다.
  • 고정밀도 메모리에서 기울기를 누적함으로써 PCM에서 최소 프로그래밍 가능한 도전성 변화에 맞는 작은 가중치 업데이트를 효과적으로 활용할 수 있다.
  • 이 방법은 필요한 PCM 프로그래밍 연산 수를 줄이고, 장치의 비이상적 특성에 미치는 영향을 완화함으로써 훈련의 안정성을 향상시킨다.
  • 확률적 반올림과 직접 e-prop 업데이트 방식은 PCM의 변동성과 제한된 해상도에 더 민감하여 성능이 열 劣하다.
  • 이 프레임워크는 PCM 기반 기반에서 스파킹 RNN의 신뢰성 있는 온라인 훈련을 가능하게 하여, e-prop가 실제 뉴로모픽 하드웨어에서 실현 가능함을 보여준다.
  • 결과적으로 하드웨어-알고리즘 공동 설계, 특히 기울기 누적 기법이 비버니시브, 저정밀도 메모리스티브 장치에서의 안정적 훈련을 위해 필수적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.