Skip to main content
QUICK REVIEW

[論文レビュー] Speech Recognition with no speech or with noisy speech

Gautam Krishna, Co Tran|arXiv (Cornell University)|Mar 2, 2019
EEG and Brain-Computer Interfaces参考文献 21被引用数 5
ひとこと要約

本稿では、音声が存在しない、または騒音環境下でも高精度な語および母音認識を実現する、電気脳波(EEG)特徴を活用した深層学習ベースの自動音声認識(ASR)システムを提案する。ゲート付き再帰ユニット(GRUs)を用い、知識蒸留とEEG特徴の統合を施したモデルは、騒音環境下での語認識で99.38%のテスト精度を達成し、EEGが劣化した音響的性能を補完できる能力を示している。

ABSTRACT

The performance of automatic speech recognition systems(ASR) degrades in the presence of noisy speech. This paper demonstrates that using electroencephalography (EEG) can help automatic speech recognition systems overcome performance loss in the presence of noise. The paper also shows that distillation training of automatic speech recognition systems using EEG features will increase their performance. Finally, we demonstrate the ability to recognize words from EEG with no speech signal on a limited English vocabulary with high accuracy.

研究の動機と目的

  • 従来の音響モデルが失敗する騒音環境下でも高精度を維持できるASRシステムの開発。
  • 音声入力が完全に存在しない状況でも、EEG信号のみで正確な語および母音認識が可能かどうかの調査。
  • 知識蒸留を用いたEEG特徴の有効性を評価し、ASR性能の向上を検証すること。
  • 劣化した音響条件下でも頑健な音声認識を実現するための最適なEEG特徴およびモデルアーキテクチャの同定。

提案手法

  • 音響特徴(MFCCs)、EEG特徴、およびそれらの連結を入力モダリティとして用い、GRUベースの深層学習モデルを学習した。
  • EEG特徴は31個の頭皮電極から抽出され、多項式カーネル次数3を用いたカーネル主成分分析(KPCA)により155次元から117次元に次元削減された。
  • 117次元のKPCA出力からデルタおよびデルタ・デルタ特徴が計算され、時間的ダイナミクスが強化され、結果として117次元のEEG特徴が得られた。
  • 教師モデルから生徒モデルへの知識転送を実現するため、温度スケーリング2およびlambda値0.2を用いた知識蒸留が適用された。
  • 生徒モデルは教師モデルのソフトラベルを模倣するように学習され、特に騒音環境下での一般化性能および耐障害性が向上した。
  • EEGのみの認識では、4チャネルのサブセット(T7, T8, Fc5, P7)が使用され、ノイズなし条件下で母音認識で93%の精度を達成し、最小限のチャネル数で十分な性能が得られることを示した。

実験結果

リサーチクエスチョン

  • RQ1音声入力が完全に存在しない状況でも、EEG信号のみで正確な語レベルの音声認識が可能かどうか。
  • RQ2背景騒音下でのASRシステム性能劣化を、EEG特徴がどの程度補完できるか。
  • RQ3EEG強化モデルを用いた知識蒸留が、ASRシステムの精度および耐障害性を向上させるか。
  • RQ4どのEEG特徴および特徴削減技術が、音声認識タスクにおいて最も効果的な表現をもたらすか。

主な発見

  • 提案されたEEGのみのASRモデルは、背景騒音下で4語('yes', 'no', 'left', 'right')を認識する際、テスト精度99.38%を達成した。
  • 騒音環境下では、EEGのみのモデルがMFCCのみのモデルを上回り、語認識で98.39%、母音認識で92.00%の精度を達成したのに対し、MFCCのみのモデルはそれぞれ94.53%および73.33%であった。
  • 温度2およびlambda 0.2を用いた知識蒸留により、生徒モデルのテスト精度はノイズなし条件下で98.61%(語)、ノイズあり条件下で97.62%(語)に向上した。
  • 多項式カーネル次数3を用いたKPCAによる155次元から117次元への次元削減が、すべてのデータセットで最良のパフォーマンスを示した。
  • T7, T8, Fc5, P7のチャネルが認識精度に最も寄与しており、これらが音声関連の神経パターンを捉える上で重要であることが示された。
  • 訓練、検証、テスト精度がすべての設定で一貫して近接していたことから、モデルに顕著な過学習は認められなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。