Skip to main content
QUICK REVIEW

[論文レビュー] Exploiting Pre-Trained ASR Models for Alzheimer's Disease Recognition Through Spontaneous Speech

Ying Qin, Wei Liu|arXiv (Cornell University)|Oct 4, 2021
Speech Recognition and Synthesis参考文献 38被引用数 9
ひとこと要約

本論文は、手動による音声転写を回避し、自発的発話に基づくアルツハイマー病(AD)の識別を目的として、事前学習済みASRモデルの下位層のみを微調整する軽量でエンドツーエンドのフレームワークを提案する。ASRエンコーダーを単純な分類器と直接統合することで、長時間音声では83.2%、短時間音声では78.0%の精度を達成し、最も優れたトランスクリプトベースのRoBERTaモデルを4.6%上回る。

ABSTRACT

Alzheimer's disease (AD) is a progressive neurodegenerative disease and recently attracts extensive attention worldwide. Speech technology is considered a promising solution for the early diagnosis of AD and has been enthusiastically studied. Most recent works concentrate on the use of advanced BERT-like classifiers for AD detection. Input to these classifiers are speech transcripts produced by automatic speech recognition (ASR) models. The major challenge is that the quality of transcription could degrade significantly under complex acoustic conditions in the real world. The detection performance, in consequence, is largely limited. This paper tackles the problem via tailoring and adapting pre-trained neural-network based ASR model for the downstream AD recognition task. Only bottom layers of the ASR model are retained. A simple fully-connected neural network is added on top of the tailored ASR model for classification. The heavy BERT classifier is discarded. The resulting model is light-weight and can be fine-tuned in an end-to-end manner for AD recognition. Our proposed approach takes only raw speech as input, and no extra transcription process is required. The linguistic information of speech is implicitly encoded in the tailored ASR model and contributes to boosting the performance. Experiments show that our proposed approach outperforms the best manual transcript-based RoBERTa by an absolute margin of 4.6% in terms of accuracy. Our best-performing models achieve the accuracy of 83.2% and 78.0% in the long-audio and short-audio competition tracks of the 2021 NCMMSC Alzheimer's Disease Recognition Challenge, respectively.

研究の動機と目的

  • 高価で誤りの多い手動トランスクリプトに依存するトランスクリプトベースのアルツハイマー病(AD)識別システムの限界を解消すること。
  • 特にAD患者の特異的発話に起因する、実環境の音響条件下での自動音声認識(ASR)性能の低下を克服すること。
  • 音声やプロソディック特徴に依存するのではなく、事前学習済みASRモデルに埋め込まれた言語的情報を活用することで、AD識別性能を向上させること。
  • ASRエンコーダーと分類ヘッドを同時に最適化する軽量でエンドツーエンドのフレームワークを構築し、より高い性能と耐障害性を実現すること。
  • 事前学習済みASRモデルに埋め込まれた言語固有の言語表現が、有効な下流AD識別に不可欠であることを実証すること。

提案手法

  • 事前学習済みASRモデル(Wav2vec2.0およびCTC-attention)の下位層のみを保持し、音声表現を抽出する。
  • 元の重いBERT風バックエンド分類器を、エンドツーエンド学習に適した単純な全結合ニューラルネットワークに置き換える。
  • 中間的なトランスクリプトを必要とせず、生の音声を入力として、モデル全体をエンドツーエンドで学習する。
  • 自己教師あり(wav2vec2.0)および教師あり(CTC-attention)のASRモデルを、タスク固有の微調整を伴う特徴抽出器として利用する。
  • 下流のAD識別タスクに適応するため、ASRエンコーダーと分類器を同時に微調整する。
  • 一般化性能を向上させるために、データオーグメンテーションおよびクラスバランス調整技術を適用する。

実験結果

リサーチクエスチョン

  • RQ1手動トランスクリプトを必要とせず、事前学習済みASRモデルをエンドツーエンドAD識別に効果的に微調整できるか?
  • RQ2事前学習済みASRモデルに埋め込まれた言語的情報を活用することで、音声のみまたはトランスクリプトベースのベースラインと比較してAD識別性能が向上するか?
  • RQ3エンドツーエンドASRベースのモデルは、RoBERTaのような最先端のトランスクリプトベースのモデルと比較して、AD検出においてどの程度の性能を示すか?
  • RQ4言語固有の事前学習済みASRモデル(例:中国語対英語)を用いることで、下流のAD識別性能にどのような影響を与えるか?
  • RQ5モデルアーキテクチャ(例:Wav2vec2.0対CTC-attention)および微調整戦略が、長時間音声と短時間音声の両方における識別精度に与える影響は何か?

主な発見

  • 提案されたエンドツーエンド手法は、2021年NCMMSC AD認識チャレンジの長時間音声トラックで83.2%、短時間音声トラックで78.0%の精度を達成した。
  • 最も優れたトランスクリプトベースのRoBERTaモデルを4.6%の絶対差で上回り、エンドツーエンドASR微調整の優位性を示した。
  • Wav2vec2.0_3-2モデルは長時間音声で最高の精度(83.2%)を達成した一方、Joint CTC-attentionモデルは短時間音声で78.0%を記録し、発話時間の制限に強いという優位性を示した。
  • 混同行列の分析から、AD被験者は最も頻繁に健康コントロールと誤分類されることが判明し、早期ADと正常発話の区別が困難であることが浮き彫りになった。
  • 研究により、事前学習済みASRモデルに埋め込まれた言語的コンテンツが、パラリンギスティックまたは音声特徴のみに依存する場合よりもAD識別に有用であることが確認された。
  • 言語固有の事前学習(例:中国語)を伴うASRエンコーダーの微調整は、下流の性能を顕著に向上させ、言語表現の質の重要性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。