Skip to main content
QUICK REVIEW

[論文レビュー] Attention-based End-to-End Models for Small-Footprint Keyword Spotting

Changhao Shan, Junbo Zhang|arXiv (Cornell University)|Mar 29, 2018
Speech Recognition and Synthesis参考文献 15被引用数 9
ひとこと要約

本論文は、エンコーダー(LSTM、GRU、またはCRNN)に続くソフトアテンション機構を用いて、キーワード検出のための固定長のコンテキストベクトルを生成する、小規模なフォルムのキーワードスプライティング(KWS)のためのアテンションベースのエンドツーエンドニューラルモデルを提案している。わずか約84Kのパラメータで、CRNNベースのモデルは1.0時間あたり1.0件の誤検出率(FA)で1.02%の誤拒否率(FRR)を達成し、Deep KWSを著しく上回り、小規模フォルムKWSの新しいSOTAを樹立した。

ABSTRACT

In this paper, we propose an attention-based end-to-end neural approach for small-footprint keyword spotting (KWS), which aims to simplify the pipelines of building a production-quality KWS system. Our model consists of an encoder and an attention mechanism. The encoder transforms the input signal into a high level representation using RNNs. Then the attention mechanism weights the encoder features and generates a fixed-length vector. Finally, by linear transformation and softmax function, the vector becomes a score used for keyword detection. We also evaluate the performance of different encoder architectures, including LSTM, GRU and CRNN. Experiments on real-world wake-up data show that our approach outperforms the recent Deep KWS approach by a large margin and the best performance is achieved by CRNN. To be more specific, with ~84K parameters, our attention-based model achieves 1.02% false rejection rate (FRR) at 1.0 false alarm (FA) per hour.

研究の動機と目的

  • HMM、グラフ探索、フレームレベルのアライメントといった複雑なコンponentを排除することで、生産用途に適したKWSパイプラインの簡素化。
  • デバイス内にデプロイ可能な、小規模フォルムで低レイテンシのKWSシステムの開発。
  • Deep KWSなどの既存のエンドツーエンドモデルよりも検出精度を向上させつつ、最小限のモデルサイズを維持すること。
  • 異なるエンコーダー構造(LSTM、GRU、CRNN)およびアテンション機構(平均、ソフト)がKWS性能に与える影響の調査。

提案手法

  • モデルは、生の音声特徴を高レベルの表現に変換するため、再帰的エンコーダー(LSTM、GRU、またはCRNN)を用いる。
  • アテンション機構は、エンコーダーの隠れ状態の上に正規化された重みを計算し、関連する時間的セグメントに注目する。
  • 重み付けされたコンテキストベクトルは、線形変換とソフトマックスを経て、キーワード検出スコアを出力する。
  • ソフトアテンションを用いることで、可変長のキーワードに対して耐性が高まり、動的に重要箇所に注目できる。
  • 事前計算されたアライメントや尤度確率を必要とせず、エンドツーエンドで学習可能である。
  • リアルタイム推論を最適化するため、窓サイズ(189フレーム)、フレームシフト(1)、スライディングウィンドウ(100フレーム)などのハイパーパrameterが最適化されている。

実験結果

リサーチクエスチョン

  • RQ1アテンションベースのエンドツーエンドモデルは、最小限のモデルサイズと低レイテンシで優れたキーワードスプライティング性能を達成できるか?
  • RQ2小規模フォルムKWSにおいて、異なるエンコーダー構造(LSTM、GRU、CRNN)は、精度とパラメータ効率の観点でどのように比較されるか?
  • RQ3実世界の条件下で、ソフトアテンション機構は平均アテンションを上回る性能を示すか?
  • RQ4GRUエンコーダーに畳み込み層を追加することで(CRNNを形成)、検出性能がさらに向上するか?

主な発見

  • CRNNベースのアテンションモデルは、わずか約84Kのパラメータで、1.0時間あたり1.0件の誤検出率で1.02%のFRRを達成し、最も優れた性能を示した。
  • ソフトアテンション機構は平均アテンションを一貫して上回り、同じFAレートでDeep KWSと比較してFRRを4%以上低減した。
  • GRUベースのモデルは同等のLSTMモデルを上回り、1-128 GRUモデルは1.0時間あたり1.0件の誤検出率で1.49%のFRRを達成した。
  • GRUエンコーダーに畳み込み層を追加することで(CRNN)、性能が向上し、16チャネルモデルは8チャネルモデルを上回った。
  • 16-2-64 CRNNモデルは、テストされたすべての構成の中で最も低いFRR(1.02%)を達成した。
  • ROC曲線から、CRNNおよびGRUモデルがLSTMモデルを著しく上回っており、特に低誤検出率の領域で顕著な差が見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。