Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Spiking Neural Networks for Large Vocabulary Automatic Speech Recognition

Jibin Wu, Emre Yılmaz|arXiv (Cornell University)|2019. 11. 19.
Advanced Memory and Neural Computing참고 문헌 80인용 수 7
한 줄 요약

이 논문은 대용량 어휘 자동 음성 인식(LVC SR)을 위한 딥 스파iking 신경망(SNN)을 제안하며, 탄성 학습 학습 방법을 사용하여 상당한 계산 비용과 추론 시간을 감소시키면서도 경쟁 가능한 ASR 정확도를 달성한다. 이는 SNN이 LVCSR 벤치마크에 성공적으로 적용된 최초의 사례이며, 동등한 ANN과 비교해 뉴로모픽 하드웨어에 배포했을 때 에너지 소비와 칩 면적을 최대 10배까지 줄일 수 있음을 보여준다.

ABSTRACT

Artificial neural networks (ANN) have become the mainstream acoustic modeling technique for large vocabulary automatic speech recognition (ASR). A conventional ANN features a multi-layer architecture that requires massive amounts of computation. The brain-inspired spiking neural networks (SNN) closely mimic the biological neural networks and can operate on low-power neuromorphic hardware with spike-based computation. Motivated by their unprecedented energyefficiency and rapid information processing capability, we explore the use of SNNs for speech recognition. In this work, we use SNNs for acoustic modeling and evaluate their performance on several large vocabulary recognition scenarios. The experimental results demonstrate competitive ASR accuracies to their ANN counterparts, while require significantly reduced computational cost and inference time. Integrating the algorithmic power of deep SNNs with energy-efficient neuromorphic hardware, therefore, offer an attractive solution for ASR applications running locally on mobile and embedded devices.

연구 동기 및 목표

  • 스파iking 신경망(SNN)을 대용량 연속 음성 인식(LVCSR)에 사용할 수 있는지의 가능성을 탐색하기 위해.
  • 스파이크 생성의 비미분 가능성으로 인해 깊은 SNN을 훈련시키는 데 도전하는 문제를 해결하기 위해.
  • 기존의 인공 신경망(ANN)과 비교해 상당한 계산 비용과 에너지 비용을 감소시킨 경쟁 가능한 ASR 성능을 달성하기 위해.
  • 실제 모바일 및 임베디드 장치에 배포하기 위해 SNN 기반 음성 모델을 기존 ASR 툴킷에 통합하기 위해.
  • 알고리즘적 효율성이 뛰어난 깊은 SNN과 에너지 효율적인 뉴로모픽 하드웨어를 조합하여 기기 내 영구 작동 음성 인식을 위한 잠재력을 입증하기 위해.

제안 방법

  • 연구는 깊은 SNN을 훈련시키기 위해 탄성 학습 규칙을 사용하여, 스파이크 네트워크에서 시간에 따라 역전파가 효과적으로 이루어지도록 한다.
  • SNN은 비미분 가능한 스파이크 함수를 근사하기 위해 서로서기 기울기 접근법을 사용해 엔드 투 엔드로 훈련된다.
  • SNN 음성 모델은 원활한 개발과 평가를 위해 파이토치-칼디 음성 인식 툴킷에 통합된다.
  • 청각 인식에 기반한 청각 인코딩 방식을 사용해 오디오 특징을 스파이크 트레인으로 인코딩하여, 스파이크 활동을 약 50% 감소시키고 청각 품질에 거의 영향을 주지 않는다.
  • 훈련된 SNN은 뉴로모픽 하드웨어(예: 로이히)에 배포되어 에너지 및 면적 효율성을 평가한다.
  • 성능과 효율성을 평가하기 위해 표준 LVCSR 벤치마크인 리브리스피치, 스위치박드, 티미트에서 실험을 수행한다.

실험 결과

연구 질문

  • RQ1딥 SNN은 최신 ANN과 비교해 경쟁 가능한 ASR 정확도를 대용량 어휘 벤치마크에서 달성할 수 있는가?
  • RQ2탄성 학습 규칙은 순차적 음성 인식 작업을 위한 깊은 SNN의 효과적인 훈련을 어떻게 가능하게 하는가?
  • RQ3기존 ANN과 비교해 뉴로모픽 하드웨어에 SNN을 배포했을 때 에너지 및 계산 효율성 향상은 어느 정도인가?
  • RQ4SNN은 파이토치-칼디와 같은 기존 ASR 소프트웨어 툴킷에 효과적으로 통합될 수 있는가?
  • RQ5청각 인식에 기반한 인코딩을 사용했을 때, 인식 성능에 영향을 주지 않으면서 스파이크 이벤트를 어느 정도 줄일 수 있는가?

주요 결과

  • 제안된 SNN 기반 음성 모델은 리브리스피치, 스위치박드, 티미트 벤치마크에서 경쟁 가능한 단어 오류율(WER)을 달성하며, 동등한 ANN과 유사한 성능을 보였다.
  • 뉴로모픽 하드웨어에 배포했을 때, 동등한 ANN과 비교해 SNN은 에너지 소비와 칩 면적을 최대 10배까지 줄였다.
  • 탄성 학습 방법은 스파이크 생성의 비미분성 문제를 극복하고 깊은 SNN의 LVCSR에 대한 효과적인 훈련을 가능하게 했다.
  • 청각 인식에 기반한 청각 인코딩 방식을 사용함으로써 스파이크 이벤트는 약 50% 감소했고, 음성 품질이나 인식 정확도에 거의 영향을 주지 않았다.
  • SNN을 파이토치-칼디 툴킷에 통합함으로써 SNN 기반 ASR 시스템의 빠른 프로토타이핑과 배포가 가능해졌다.
  • 결과적으로, 모바일 및 임베디드 시스템에서 기기 내 영구 작동 음성 인식을 위한 고성능·저전력 SNN의 구현 가능성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.