Skip to main content
QUICK REVIEW

[論文レビュー] Low-Power Audio Keyword Spotting using Tsetlin Machines

Jie Lei, Tousif Rahman|arXiv (Cornell University)|Jan 27, 2021
Music and Audio Processing参考文献 43被引用数 4
ひとこと要約

本稿では、演算負荷の高い演算をブール論理に置き換えることで、より高速な収束、少ないパラメータ数、低消費電力が実現できる論理ベースの機械学習モデル、Tsetlinマシン(TMs)を用いた低消費電力キーワード検出(KWS)システムを提案する。TMベースのKWSパイプラインは、顕著に低い複雑さとハードウェアフットプリントを実現しながら、DNNと同等の精度を達成しており、エッジAIデバイスにおけるオンチップ実装の強力な可能性を示している。

ABSTRACT

The emergence of Artificial Intelligence (AI) driven Keyword Spotting (KWS) technologies has revolutionized human to machine interaction. Yet, the challenge of end-to-end energy efficiency, memory footprint and system complexity of current Neural Network (NN) powered AI-KWS pipelines has remained ever present. This paper evaluates KWS utilizing a learning automata powered machine learning algorithm called the Tsetlin Machine (TM). Through significant reduction in parameter requirements and choosing logic over arithmetic based processing, the TM offers new opportunities for low-power KWS while maintaining high learning efficacy. In this paper we explore a TM based keyword spotting (KWS) pipeline to demonstrate low complexity with faster rate of convergence compared to NNs. Further, we investigate the scalability with increasing keywords and explore the potential for enabling low-power on-chip KWS.

研究の動機と目的

  • エッジデバイスにおけるニューラルネットワークベースのキーワード検出(KWS)の高いエネルギー消費と計算複雑性に対処すること。
  • Tsetlinマシン(TMs)が、DNNの代替としてKWSパイプラインで低消費電力で使用可能かどうかを検討すること。
  • さまざまなハイパーパramータとキーワード数を想定した状況で、TMベースのKWSシステムのスケーラビリティとエネルギー効率を評価すること。
  • 算術計算ではなく論理処理を用いることで、KWSパイプラインのハードウェア加速の可能性を示すこと。
  • TM特有の最適化によりモデルサイズとシステム遅延を最小限に抑えることで、リアルタイムでオンチップでのKWSを実現すること。

提案手法

  • KWSパイプラインはメル周波数 cepstrum コefficient(MFCCs)を入力特徴として用い、分位数ビニングを用いてブール形式に離散化する。
  • Tsetlinマシンは、勾配ベースの誤差逆伝播をフィードバック駆動型学習オートマトンに置き換えた、句ベースの論理アーキテクチャを用いてこれらのブール特徴を処理する。
  • 句の数、句のサイズ、しきい値などのハイパーパramータを、精度、エネルギー効率、収束速度のバランスをとるように調整する。
  • リアルタイム性能と低消費電力埋め込み環境での消費電力を評価するために、Raspberry Piにシステムを実装する。
  • TensorFlow Speech Commandsデータセットを用いて、標準的なDNNおよび量子化済みCNNモデルとパイプラインを比較する。
  • 信号処理の最適化には、性能損失を最小限に抑えつつMFCC次元を低減するための窓関数の調整が含まれる。

実験結果

リサーチクエスチョン

  • RQ1TsetlinマシンベースのKWSパイプラインは、顕著に少ないパラメータ数を用いても、DNNと同等の精度を達成できるか?
  • RQ2句の数とフィードバックハイパーパramータの影響は、TMベースのKWSシステムの収束速度とエネルギー効率にどのように現れるか?
  • RQ3MFCCの離散化を単純化(例:1特徴あたり1つのブール値)しても、分類性能が著しく低下しない程度にまで簡素化できるか?
  • RQ4キーワード数の増加に伴って、TMベースのKWSパイプラインの精度とリソース使用量はどのように変化するか?
  • RQ5TMベースのシステムは、低消費電力マイコンプロセッサに効果的に実装可能であり、オンチップでリアルタイムのキーワード検出を可能にするか?

主な発見

  • TsetlinマシンベースのKWSパイプラインは、DNNおよび量子化済みCNNと同等の精度を達成しながら、パラメータ数および句の数を桁違いに削減した。
  • 勾配降下法や算術演算のないため、従来のニューラルネットワークと比較して、学習中の収束が著しく速かった。
  • MFCC特徴量を1係数あたり1つのブール値に簡略化しても性能にほとんど影響がなく、モデルサイズと計算負荷の顕著な低減が可能となった。
  • 句の数を減らし、しきい値ハイパーパラメータを最適化することで、精度を損なわずエネルギー効率と遅延が向上した。
  • 論理ベースの計算が inherently エネルギー効率が高いため、ハードウェア加速の可能性が著しく高いことが示された。
  • Raspberry Pi上でシステムが正常に評価され、エッジAIアプリケーションにおける低消費電力・オンチップ実装の実現可能性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。