Skip to main content
QUICK REVIEW

[論文レビュー] Improving EEG based Continuous Speech Recognition

Gautam Krishna, Co Tran|arXiv (Cornell University)|Nov 24, 2019
Speech Recognition and Synthesis参考文献 15被引用数 10
ひとこと要約

本研究では、EEGに基づく連続音声認識(CSR)を改善するために、音声的および発音的特徴をEEGから予測する事前学習済みモデルでGRUエンコーダーの重みを初期化し、ビームサーチ中に外部言語モデルを統合し、低誤差の発音的特徴予測を実証した。これらの手法により、より大きな語彙での語誤り率(WER)が84.9%から74.45%に顕著に低下し、補助技術用途における耐障害性が向上した。

ABSTRACT

In this paper we introduce various techniques to improve the performance of electroencephalography (EEG) features based continuous speech recognition (CSR) systems. A connectionist temporal classification (CTC) based automatic speech recognition (ASR) system was implemented for performing recognition. We introduce techniques to initialize the weights of the recurrent layers in the encoder of the CTC model with more meaningful weights rather than with random weights and we make use of an external language model to improve the beam search during decoding time. We finally study the problem of predicting articulatory features from EEG features in this paper.

研究の動機と目的

  • 特に言語機能に障害を有する人々を対象としたEEGベースの連続音声認識(CSR)システムの性能が限定的であるという問題に取り組む。
  • CTCベースのASRモデルにおける再帰的ニューラルネットワーク(RNN)エンコーダーの重み初期化の限界を克服する。
  • 浅い融合による外部4-gram言語モデルをCTCビームサーチに統合することで、デコードの耐障害性を向上させる。
  • エンコーダーにおける表現学習の向上を図るため、EEGから発音的特徴を予測する有効性を検討する。
  • 従来のEEG-ASR研究と比較して、より大きな英語語彙で改善されたCSR性能を実証する。

提案手法

  • 30次元のEEG入力を用いて、MFCC(13次元)と発音的特徴(6次元)を連結した特徴を予測する2層のGRUモデルを、平均二乗誤差(MSE)損失関数を用いて事前学習する。
  • CTCエンコーダーの最初の2層のGRU層を、事前学習済み回帰モデルから得た重みで初期化し、ランダム初期化に代える。
  • RNN表現をテキストトークンにマッピングするために、32フィルタ、カーネルサイズ2、1つのリカージブスタックを備えた時空間畳み込みネットワーク(TCN)を用いる。
  • 120エポックにわたり、バッチサイズ32、ドロップアウト(0.1)を用いた正則化を伴うAdam最適化アルゴリズムを用いてCTC損失を最適化する。
  • 文字レベルのCTCデコーダーを用い、外部4-gram言語モデルを用いた浅い融合によるビームサーチを実装する。
  • 予測された発音的特徴と真値との間のRMSEおよび正規化RMSEを用いて、発音的特徴予測性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1CTCベースのEEG-ASRモデルにおけるGRUエンコーダーの重みを、事前学習済み回帰モデルで初期化することで、認識精度が向上するか?
  • RQ2ビームサーチデコード中に外部言語モデルを統合することで、EEGベースのCSRにおける語誤り率(WER)はどの程度低減されるか?
  • RQ3TCNベースのアーキテクチャを用いて、EEG信号から発音的特徴をどの程度正確に予測できるか?
  • RQ4前頭前野および側頭葉のセンサーからのEEG特徴を組み合わせることで、1つの領域のみを使用する場合と比較してCSR性能が向上するか?
  • RQ5MFCC+発音的特徴→テキストモデルから得た追加の事前学習済みGRU層を、より大きな語彙でのWER低下に寄与するか?

主な発見

  • エンコーダーに事前学習済みGRU重みを適用することで、180のテスト文および1112個の固有語を含むデータセットBにおいて、WERが84.9%から74.45%に低下した。
  • ビームサーチ中に外部4-gram言語モデルを統合することで、デコード性能が顕著に向上し、WERが84.9%から74.45%に低下した。
  • データセットAでは平均RMSEが0.632、正規化RMSEが0.115であり、データセットBではRMSEが1.30、正規化RMSEが0.238であった。
  • 前頭前野および側頭葉の両方のEEG特徴(85次元)を組み合わせた場合、WERは85.32%となり、前頭前野(85.45%)や側頭葉(86.52%)のみを使用する場合よりもわずかに優れた性能を示した。
  • MFCC+発音的特徴→テキストモデルから得た固定された事前学習済みGRU層ペア(128, 64ユニット)をエンコーダーに追加することで、データセットAの15個のテスト文においてWERが78.39%に低下し、より大きな語彙での改善がわずかに得られた。
  • 提案手法は、180文、1112語のより大きな語彙でWERが74.45%に低下し、類似ベンチマークにおける従来のEEG-ASRシステムを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。