Skip to main content
QUICK REVIEW

[論文レビュー] EEG based Continuous Speech Recognition using Transformers

Gautam Krishna, Co Tran|arXiv (Cornell University)|Dec 31, 2019
EEG and Brain-Computer Interfaces参考文献 16被引用数 4
ひとこと要約

本論文は、トランスフォーマー・アーキテクチャを用いたエンド・ツー・エンドのEEGベース連続発話認識を検討し、小規模な語彙(例:5つの固有の文)ではRNNベースのモデルよりも高速な学習と優れた性能を示すが、語彙サイズが増加するにつれてRNN-CTCモデルがトランスフォーマーを上回り、小規模なテストを過ぎるとWERが著しく上昇することが明らかになった。

ABSTRACT

In this paper we investigate continuous speech recognition using electroencephalography (EEG) features using recently introduced end-to-end transformer based automatic speech recognition (ASR) model. Our results demonstrate that transformer based model demonstrate faster training compared to recurrent neural network (RNN) based sequence-to-sequence EEG models and better performance during inference time for smaller test set vocabulary but as we increase the vocabulary size, the performance of the RNN based models were better than transformer based model on a limited English vocabulary.

研究の動機と目的

  • トランスフォーマーに基づくモデルを用いたエンド・ツー・エンドのEEGからテキストへの連続発話認識の実現可能性を検討すること。
  • トレーニング速度、推論性能、語彙サイズの増加に対するロバスト性の観点から、トランスフォーマーに基づくモデルと標準的なRNN-CTCモデルを比較すること。
  • 特にEEG入力と予測テキストとの間のアライメントを考慮して、EEGベースのシーケンスモデリングにおけるアテンション機構の解釈可能性を評価すること。
  • データサイズとモデル容量の性能への影響を評価すること、特にEEG信号の複雑さとノイズの影響を考慮して。

提案手法

  • 研究では、エンコーダーとデコーダーの両方に8層のスタックを用いた標準的なトランスフォーマー・エンコーダー・デコーダー・アーキテクチャを採用し、各層にはマルチヘッド自己注意とフィードフォワードサブレイヤーを含み、残差接続とレイヤー正則化を適用した。
  • 系列の順序を保持するために、正弦関数と余弦関数を用いた位置エンコーディングを適用し、d_model = 256、d_ff = 1024、d_k = d_v = 8、h = 32のアテンションヘッド数を設定した。
  • エンコーダーとデコーダー間で埋め込み重みを共有し、ソフトマックス活性化関数を用いた全結合層により1時刻ごとに1単語を予測する。
  • トレーニングにはAdam最適化法を用い、120エポック、バッチサイズ100で実施し、交差エントロピー損失関数を用いた。
  • 推論には4-グラム言語モデル(シャロウ・フェージョン)を併用したビームサーチを採用し、終端トークンが出現するまで生成を継続する。
  • モデルは、先行研究から得た2つのEEGデータセット(AおよびB)を用いて評価され、テストセットサイズの変化に応じて単語単位のWERを主指標として用いた。

実験結果

リサーチクエスチョン

  • RQ1小規模な語彙テストセットにおいて、トランスフォーマー・アーキテクチャがEEGベース連続発話認識でRNN-CTCモデルを上回るか?
  • RQ2語彙サイズが増加するにつれて、特にWERの観点からモデルの性能はどのように変化するか?
  • RQ3複雑でノイズの多い性質を示すEEG信号を考慮すると、トランスフォーマーのアテンション機構は意味的に解釈可能か?
  • RQ4EEGデータに対して、トランスフォーマー・モデルはRNN-CTCモデルよりも高速なトレーニングと推論時間を提供するか?
  • RQ5データスケーリングの向上が、大規模語彙におけるトランスフォーマーの性能低下を是正できるか?

主な発見

  • 5つの固有の文からなるテストセットでは、トランスフォーマー・モデルはデータセットAで67.7%、データセットBで62.5%のWERを達成し、RNN-CTCモデルを上回った。
  • 語彙サイズが30の固有の文に増加すると、トランスフォーマーのWERはデータセットAで93.95%、データセットBで96.8%に上昇し、顕著な性能低下が確認された。
  • [12]で提示されたRNN-CTCモデルは、テストされたすべての語彙サイズにおいて、トランスフォーマー・モデルを一貫して上回り、より低いWERを達成した。
  • トランスフォーマー・モデルは、1例あたり0.017分(データセットA)でRNN-CTCモデルの0.041分より2.4倍速く学習が完了したが、モデルサイズが大きいため推論は遅くなった。
  • トレーニングは高速であったが、1例あたりの推論時間はトランスフォーマーが0.016分、RNN-CTCモデルが0.0015分と、パラメータ数の増加と長時間の重み読み込み時間が主な要因で遅くなった。
  • EEG入力に対するアテンション可視化は解釈不能であり、アテンション重みと意味的な言語的・神経的特徴との間には明確な対応関係が確認できなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。