Skip to main content
QUICK REVIEW

[論文レビュー] PhyAAt: Physiology of Auditory Attention to Speech Dataset

Nikesh Bajaj, Jesús Requena Carrión|arXiv (Cornell University)|May 23, 2020
EEG and Brain-Computer Interfaces参考文献 35被引用数 6
ひとこと要約

本論文は、自然な会話刺激を用いた聴覚的注意実験中に、騒音、意味的性質、長さの異なる条件下で、25名の非ネイティブ英語話者の14チャネルEEG、GSR、PPG信号を収集した、PhyAAtと呼ばれる公開データセットを紹介する。スペクトル特徴量とSVMモデルを用いて、注意レベル、騒音レベル、意味的性質、語の想起に関する予測性能が顕著に高く(p << 0.0001)なっており、すべてが偶然より優れている。結果は、オープンソースのphyaat Pythonライブラリを用いて再現可能である。

ABSTRACT

Auditory attention to natural speech is a complex brain process. Its quantification from physiological signals can be valuable to improving and widening the range of applications of current brain-computer-interface systems, however it remains a challenging task. In this article, we present a dataset of physiological signals collected from an experiment on auditory attention to natural speech. In this experiment, auditory stimuli consisting of reproductions of English sentences in different auditory conditions were presented to 25 non-native participants, who were asked to transcribe the sentences. During the experiment, 14 channel electroencephalogram, galvanic skin response, and photoplethysmogram signals were collected from each participant. Based on the number of correctly transcribed words, an attention score was obtained for each auditory stimulus presented to subjects. A strong correlation ($p&lt;&lt;0.0001$) between the attention score and the auditory conditions was found. We also formulate four different predictive tasks involving the collected dataset and develop a feature extraction framework. The results for each predictive task are obtained using a Support Vector Machine with spectral features, and are better than chance level. The dataset has been made publicly available for further research, along with a python library - phyaat to facilitate the preprocessing, modeling, and reproduction of the results presented in this paper. The dataset and other resources are shared on webpage - https://phyaat.github.io.

研究の動機と目的

  • 自然な会話への聴覚的注意状態における生体反応を捉えるデータセットの開発を目的とし、既存の文献においてそのようなリソースが不足している点を補う。
  • 字幕化された語の正確性を用いて注意スコアを定量化し、聴覚的条件下での注意レベルの客観的評価を可能にする。
  • BCIや認知監視の応用を想定し、多モodalな生体信号(EEG、GSR、PPG)を用いた注意関連状態の予測モデリングを可能にする。
  • preprocessing、特徴抽出、モデリングのための再現可能なオープンソースフレームワークを提供する。
  • 教育、ゲーム、補助技術の応用を含め、聴覚処理および注意の脳メカニズムに関する研究を支援する。

提案手法

  • 被験者1人あたり144試行のディコチックリスニング型実験を実施し、聴取、字幕作成、休息の各フェーズを含む。騒音レベル(N、S、L)、意味的性質、刺激長の3つの聴覚的条件を設定した。
  • 各試行中に128 Hzのサンプリングレートで14チャネルのEEG、筋電反応(GSR)、光容積脈波計(PPG)信号を収集した。
  • 語の正しく字幕化された数を試行ごとの注意スコアとして算出し、わずかな綴りの誤りは無視した。これにより、注意レベルを定量化した。
  • Welch法を用いて、各EEGチャネルごとに6つのスペクトルパワーフィーチャー(デルタ、テータ、アルファ、ベータ、低周波ガンマ、高周波ガンマ)をバンドパワー推定により抽出した。
  • 特徴抽出の前段階として、EEG信号のノイズ除去にウェーブレットベースのアーチファクト除去法(db3、β=0.1、N=128)を適用した。
  • 10分割交差検証と正則化(C)を用い、RBFカーネルを用いたサポートベクターマシン(SVM)を、4つの予測タスク(注意スコア、騒音レベル、意味的性質、語の想起(LWR))に訓練した。

実験結果

リサーチクエスチョン

  • RQ1字幕化の正確性から導かれる注意スコアと、音声刺激の聴覚的条件(騒音レベル、意味的性質、長さ)との間に有意な相関が認められるか?
  • RQ2EEG、GSR、PPGなどの生体信号を用いて、自然な会話への注意レベルを偶然より高い精度で予測できるか?
  • RQ3EEG信号からのスペクトル特徴量が、聴覚刺激の意味的性質や語の想起をどの程度正確に予測できるか?
  • RQ4EEGスペクトル特徴量を用いた基本的なSVMモデルは、異なる実験条件下で注意関連状態をどの程度効果的に予測できるか?
  • RQ5提供されたphyaatライブラリとデータセットを用いて、提案された特徴抽出およびモデリングパイプラインを再現可能か?

主な発見

  • 注意スコアと聴覚的条件との間に強く有意な相関(p << 0.0001)が確認され、注意スコアの妥当性が裏付けられた。
  • 注意スコア予測用のSVMモデル(T1)は、テストセットで平均絶対誤差(MAE)が29.65を記録し、100語の文では約50となる偶然の水準(~50)を著しく上回った。
  • 騒音レベル予測用のモデル(T2)はMAEが4.75を記録し、生体信号から背景騒音レベルを信頼性高く推定できることを示した。
  • 意味的性質分類(T3)では、SVMモデルが56%の正答率を示し、偶然の水準(50%、1/2)を上回った。これは意味的性質に顕著な神経的関連が存在することを示した。
  • 語の想起予測(T4)では、81%の正答率を達成し、偶然の水準(33.3%、1/3)を大きく上回った。これは想起性能に対する強い予測力があることを示した。
  • すべての予測タスクで偶然より優れた性能が得られ、また、preprocessing、特徴抽出、モデリング関数を備えたオープンソースのphyaatライブラリを用いて結果が再現可能であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。