Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient recurrent architectures through activity sparsity and sparse back-propagation through time

Anand Subramoney, Khaleelulla Khan Nazeer|arXiv (Cornell University)|2022. 06. 13.
Advanced Memory and Neural Computing인용 수 7
한 줄 요약

이 논문은 이벤트 기반 게이팅 순환 유닛(EGRU)을 제안한다. EGRU는 단위 간의 희소 통신을 위해 임계값을 기반으로 하는 이산적 이벤트를 사용하는 스파iking 유사 RNN 변종이다. 전방 및 역방향 계산을 모두 희소하게 하여 시간 단계가 아닌 이벤트 수에 따라 확장되도록 함으로써, 순차 작업에서 경쟁력 있는 성능을 달성하면서도 메모리와 계산 자원을 크게 절감한다. 이는 신경모방 및 에너지 제약이 있는 시스템에 특히 유리하다.

ABSTRACT

Recurrent neural networks (RNNs) are well suited for solving sequence tasks in resource-constrained systems due to their expressivity and low computational requirements. However, there is still a need to bridge the gap between what RNNs are capable of in terms of efficiency and performance and real-world application requirements. The memory and computational requirements arising from propagating the activations of all the neurons at every time step to every connected neuron, together with the sequential dependence of activations, contribute to the inefficiency of training and using RNNs. We propose a solution inspired by biological neuron dynamics that makes the communication between RNN units sparse and discrete. This makes the backward pass with backpropagation through time (BPTT) computationally sparse and efficient as well. We base our model on the gated recurrent unit (GRU), extending it with units that emit discrete events for communication triggered by a threshold so that no information is communicated to other units in the absence of events. We show theoretically that the communication between units, and hence the computation required for both the forward and backward passes, scales with the number of events in the network. Our model achieves efficiency without compromising task performance, demonstrating competitive performance compared to state-of-the-art recurrent network models in real-world tasks, including language modeling. The dynamic activity sparsity mechanism also makes our model well suited for novel energy-efficient neuromorphic hardware. Code is available at https://github.com/KhaleelKhan/EvNN/.

연구 동기 및 목표

  • 표준 RNN의 훈련 및 구현 시 높은 계산 및 메모리 비용 문제를 해결하기 위해, 특히 시간에 따른 역전파(BPTT)를 통해.
  • 자원 제약이 있는 환경에서 RNN의 효율성과 실제 적용 요구 사항 사이의 격차를 메우기 위해.
  • 희소하고 이벤트 기반의 통신을 통해 생물학적 신경 동역학을 모방함으로써 에너지 효율적이고 확장 가능한 순환 모델을 개발하기 위해.
  • 성능을 유지하면서도 계산 부담을 줄이는 이론적으로 탄탄한 희소 역전파 방법을 개발하기 위해.

제안 방법

  • 내부 상태가 임계값을 초과할 때만 통신이 이루어지는 임계값 기반의 이벤트 생성 메커니즘을 게이팅 순환 유닛(GRU)에 도입한다.
  • 하이브리드 동역학 시스템에 대해 애드조인트 방법을 기반으로 유도한 이벤트 기반 기울기 업데이트 규칙을 도입하여 시간에 따른 역전파를 희소하게 한다.
  • 전방 계산을 연속 시간 동역학 시스템으로 모델링하여, 상태 갱신이 이벤트 발생 시에만 이루어지도록 하여 불필요한 계산을 줄인다.
  • 이론적 분석을 통해 전방 및 역방향 계산 복잡도가 시간 단계 수가 아니라 이벤트 수에 비례함을 확인한다.
  • 이벤트 발생 시에만 매개변수를 업데이트하는 이벤트 기반 학습 규칙을 활용하여 희소한 매개변수 업데이트를 보장한다.
  • 이 프레임워크는 표준 순환 동역학을 이벤트 기반 동역학으로 대체함으로써, LSTM을 포함한 모든 RNN 아키텍처에 일반화하여 적용할 수 있다.

실험 결과

연구 질문

  • RQ1RNN에서 활동 희소성이 추론 및 훈련 중 계산 및 메모리 비용을 크게 줄일 수 있는가, 성능 손실 없이?
  • RQ2이벤트 기반 통신을 사용할 때 시간에 따른 역전파를 어떻게 희소하고 효율적으로 만들 수 있는가?
  • RQ3이벤트 기반 RNN 아키텍처가 표준 GRU 및 LSTM과 비교해 실제 순차 작업에서 경쟁력 있는 성능을 유지하는가?
  • RQ4모델의 희소성이 네트워크 활동에 비례하여 어떻게 확장되는가, 그리고 이는 뉴로모픽 하드웨어에서의 에너지 효율성에 어떤 영향을 미치는가?
  • RQ5제안된 방법이 GRU를 초월한 다른 RNN 아키텍처로 일반화될 수 있는가?

주요 결과

  • EGRU 모델은 문자 수준 및 단어 수준 작업을 포함한 언어 모델링 벤치마크에서 최신 GRU 및 LSTM 모델과 경쟁 가능한 성능을 달성한다.
  • 전방 계산 복잡도와 매개변수 업데이트 복잡도가 시간 단계 수가 아니라 이벤트 수에 비례하여 선형적으로 증가하므로, 상당한 효율성 향상이 가능하다.
  • 추론 및 훈련 중에 높은 수준의 활동 희소성이 관찰되며, 일부 설정에서는 어떤 시점에도 최대 90%의 단위가 비활성 상태에 있다.
  • 이론적 분석을 통해 연속 시간 근사에서 기울기 계산 비용이 네트워크 내 이벤트 수에 비례함을 확인하였다.
  • 모델은 비균일하게 간격을 두고 정렬된 순차 데이터와도 자연스럽게 호환되며, 이벤트 기반 소프트웨어 프리미티브를 통해 효율적으로 구현할 수 있다.
  • 이 프레임워크는 뉴로모픽 하드웨어로 직접 번역 가능하며, 활동 희소성이 에너지 효율성으로 바로 이어지며, 특히 현장 메모리 및 희소 매개변수 접근과 결합될 경우 더욱 유리하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.