Skip to main content
QUICK REVIEW

[論文レビュー] Self-supervised models of audio effectively explain human cortical responses to speech

Aditya R. Vaidya, Shailee Jain|arXiv (Cornell University)|May 27, 2022
Speech and Audio Processing被引用数 17
ひとこと要約

本研究では、自己教師あり音声表現モデル(例:wav2vec 2.0、HuBERT)が、聴覚皮質全体における人間のfMRI反応を予測する際、従来の音響特徴量および教師ありモデルを著しく上回ることを示している。層ごとの表現を分析した結果、下位のSSL層は一次聴覚領域におけるスペクトロテイマル特徴を符号化しているのに対し、より深い層は音声的および意味的情報を捉え、人間の脳における音声処理の階層的プロセスを模倣していることが明らかになった。

ABSTRACT

Self-supervised language models are very effective at predicting high-level cortical responses during language comprehension. However, the best current models of lower-level auditory processing in the human brain rely on either hand-constructed acoustic filters or representations from supervised audio neural networks. In this work, we capitalize on the progress of self-supervised speech representation learning (SSL) to create new state-of-the-art models of the human auditory system. Compared against acoustic baselines, phonemic features, and supervised models, representations from the middle layers of self-supervised models (APC, wav2vec, wav2vec 2.0, and HuBERT) consistently yield the best prediction performance for fMRI recordings within the auditory cortex (AC). Brain areas involved in low-level auditory processing exhibit a preference for earlier SSL model layers, whereas higher-level semantic areas prefer later layers. We show that these trends are due to the models' ability to encode information at multiple linguistic levels (acoustic, phonetic, and lexical) along their representation depth. Overall, these results show that self-supervised models effectively capture the hierarchy of information relevant to different stages of speech processing in human cortex.

研究の動機と目的

  • 自己教師あり音声表現が、既存の音響的または意味的モデルと比較して、自然音声に対する人間の皮質反応をよりよく予測できるかどうかを評価すること。
  • 自己教師ありモデルの異なる層が、人間の聴覚皮質内の異なる機能的領域に対応する仕組みを調査すること。
  • 異なる深さの自己教師ありモデルが、どの言語的レベル(音響的、音素的、語彙的)を符号化しているかを特定すること。
  • SSLモデル内の表現階層が、人間の音声処理の仮説上の段階とどの程度一致するかを評価すること。

提案手法

  • 小説の音声データで訓練された4つのSSLモデル(APC、wav2vec、wav2vec 2.0、HuBERT)の中央層および深層部の隠れ表現を抽出した。
  • ボクセル単位の符号化モデルを用い、リッジ回帰を用いて、SSL特徴量を入力として音声刺激からのfMRI BOLD反応を予測した。
  • 音響ベースライン(メルスペクトログ램、スペクトロテイマル特徴)、音素的特徴、意味的単語埋め込みと比較した。
  • 分散分割分析を実施し、SSL特徴量と手作業で作成した特徴量が脳反応予測に寄与する共通および固有の寄与を定量化した。
  • 線形プローブを用いて、各SSL層にどの言語的情報(FBANK、スペクトロテイマル、音素、語)が符号化されているかを評価した。
  • 正確な語および音素のタイミングをナラティブ音声と対応するテキストから得るため、強制同期処理を実施した。

実験結果

リサーチクエスチョン

  • RQ1自己教師あり音声表現が、従来の音響的または意味的特徴と比較して、自然音声に対する人間の皮質反応をより正確に予測できるか?
  • RQ2SSLモデル内のどの層が聴覚皮質の特定の領域の活動を最もよく予測できるか?
  • RQ3SSLモデルの異なる深さで、どの種類の言語的情報(周波数的、音素的、意味的)が符号化されているか?
  • RQ4SSLモデル内の表現階層が、人間の脳における音声処理の階層的プロセスとどの程度類似しているか?

主な発見

  • wav2vec 2.0およびHuBERTの中央層および上位中央層が、聴覚皮質全体におけるfMRI反応の予測精度が最も高く、音響ベースラインおよび教師ありモデルを上回った。
  • 下位SSL層は一次聴覚皮質の反応を最もよく予測したが、より深い層は音声的および意味的処理に関与する上位領域の活動を予測した。
  • 分散分割分析により、最も性能の優れたSSL層が、スペクトロテイマル、音素的、一部の意味的情報を組み合わせて捉えており、単一のベースライン特徴空間よりも脳反応の独自の分散を説明する割合が高かった。
  • 線形プローブの結果、最も下位のSSL層はFBANKおよびスペクトロテイマル特徴を符号化しており、中間層はスペクトロテイマルおよび音素的特徴を、上位層は語の識別を符号化しており、言語的表現の階層的進行が確認された。
  • 音素の識別は、wav2vec 2.0およびHuBERTの最上位層で最もよく予測された。これは、明示的な言語的教師なし条件下でも文脈依存の音素認識が行われている可能性を示唆している。
  • SSLモデル全体の表現的深さは、人間の脳における音声処理の仮説上の段階と密接に一致しており、人工的および生物学的音声処理システム間に構造的同型性がある可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。