Skip to main content
QUICK REVIEW

[論文レビュー] Deep Spiking Neural Networks for Large Vocabulary Automatic Speech Recognition

Jibin Wu, Emre Yılmaz|arXiv (Cornell University)|Nov 19, 2019
Advanced Memory and Neural Computing参考文献 80被引用数 7
ひとこと要約

本論文では、大規模語彙自動音声認識(LVCSR)のための深層スパikingニューラルネットワーク(SNN)を提案し、タンドム学習訓練手法を用いることで、顕著に低い計算コストと推論時間で競争力のあるASR精度を達成した。本研究は、SNNをLVCSRベンチマークに初めて成功裏に適用した。ニューロモルフィックハードウェアにデプロイした場合、同等の人工ニューラルネットワーク(ANN)と比較して、エネルギーとチップ面積が最大10倍まで削減された。

ABSTRACT

Artificial neural networks (ANN) have become the mainstream acoustic modeling technique for large vocabulary automatic speech recognition (ASR). A conventional ANN features a multi-layer architecture that requires massive amounts of computation. The brain-inspired spiking neural networks (SNN) closely mimic the biological neural networks and can operate on low-power neuromorphic hardware with spike-based computation. Motivated by their unprecedented energyefficiency and rapid information processing capability, we explore the use of SNNs for speech recognition. In this work, we use SNNs for acoustic modeling and evaluate their performance on several large vocabulary recognition scenarios. The experimental results demonstrate competitive ASR accuracies to their ANN counterparts, while require significantly reduced computational cost and inference time. Integrating the algorithmic power of deep SNNs with energy-efficient neuromorphic hardware, therefore, offer an attractive solution for ASR applications running locally on mobile and embedded devices.

研究の動機と目的

  • スパikingニューラルネットワーク(SNN)を大規模語彙連続音声認識(LVCSR)に使用する可能性を検討すること。
  • スパイク生成の非微分可能特性による、深層SNNのトレーニングの課題に対処すること。
  • 従来の人工ニューラルネットワーク(ANN)と比較して、顕著に低い計算コストおよびエネルギー消費で競争力のあるASR性能を達成すること。
  • SNNベースの音響モデルを既存のASRツールキットに統合し、モバイルおよび組み込みデバイスへの実用的デプロイメントを可能にすること。
  • アルゴリズム効率の高い深層SNNとエネルギー効率の高いニューロモルフィックハードウェアを組み合わせることで、デバイス内での常時稼働型音声認識の可能性を示すこと。

提案手法

  • 本研究では、時系列のバックプロパゲーションを効果的に可能にするために、タンドゥム学習ルールを用いて深層SNNをトレーニングした。
  • 非微分可能なスパイク関数を近似するため、サーロジット勾配アプローチを用いてSNNをエンドツーエンドでトレーニングした。
  • SNN音響モデルをPyTorch-Kaldi音声認識ツールキットに統合し、スムーズな開発と評価を可能にした。
  • 聴覚に配慮した音声符号化方式を用いて、音声特徴をスパイクトレインに変換し、スパイク活動を約50%削減したが、知覚的劣化は最小限に抑えられた。
  • トレーニング済みのSNNをニューロモルフィックハードウェア(例:Loihi)にデプロイし、エネルギーおよび面積効率を評価した。
  • 性能と効率の両面を評価するために、LibriSpeech、Switchboard、TIMITといった標準的なLVCSRベンチマークで実験を実施した。

実験結果

リサーチクエスチョン

  • RQ1深層SNNは、最先端のANNと同等の性能を示す大規模語彙ベンチマークで、競争力のあるASR精度を達成できるか?
  • RQ2タンドゥム学習ルールは、時系列音声認識タスクに適した深層SNNの効果的なトレーニングをどのように可能にするか?
  • RQ3従来のANNと比較して、ニューロモルフィックハードウェアにSNNをデプロイした場合のエネルギーおよび計算効率の向上はどの程度か?
  • RQ4SNNは、PyTorch-Kaldiのような既存のASRソフトウェアツールキットに効果的に統合できるか?
  • RQ5知覚に配慮した符号化方式を用いることで、どの程度のスパイクイベントの削減が可能になるか、かつ認識精度に悪影響を及えないか?

主な発見

  • 提案されたSNNベースの音響モデルは、LibriSpeech、Switchboard、TIMITベンチマークで、ANNと同等の競争力のある語誤り率(WER)を達成した。
  • ニューロモルフィックハードウェアにデプロイした場合、同等のANNと比較して、SNNはエネルギーとチップ面積を最大10倍まで削減した。
  • タンドゥム学習法により、スパイク生成の非微分性という課題を克服し、LVCSR向けに深層SNNの効果的なトレーニングが可能になった。
  • 知覚に配慮した聴覚符号化方式の使用により、スパイクイベントは約50%削減されたが、音声品質や認識精度への影響はほとんどなかった。
  • SNNをPyTorch-Kaldiツールキットに統合することで、SNNベースのASRシステムの迅速なプロトタイピングとデプロイメントが可能になった。
  • 本結果は、モバイルおよび組み込みシステムにおける、高性能で低消費電力なSNNをデバイス内での常時稼働型音声認識にデプロイ可能であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。