Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Modal Detection of Alzheimer's Disease from Speech and Text

Amish Mittal, Sourav Sahoo|arXiv (Cornell University)|Nov 30, 2020
Voice and Speech Disorders参考文献 49被引用数 9
ひとこと要約

本論文は、転移学習を用いて音声とテキストトランスクリプトを統合するマルチモーダル深層学習フレームワークを提案し、Dementiabank Pitt コーパスでアルツハイマー病(AD)を 85.3% の正確度で検出する。この手法は、音声埋め込みに CNN を、テキストに BERT-CNN 統合を用い、予測をエアリー・レイト統合により統合する。自動音声認識(ASR)で生成されたトランスクリプトを用いても、78.8% の正確度を達成し、強靭性を示す。

ABSTRACT

Reliable detection of the prodromal stages of Alzheimer's disease (AD) remains difficult even today because, unlike other neurocognitive impairments, there is no definitive diagnosis of AD in vivo. In this context, existing research has shown that patients often develop language impairment even in mild AD conditions. We propose a multimodal deep learning method that utilizes speech and the corresponding transcript simultaneously to detect AD. For audio signals, the proposed audio-based network, a convolutional neural network (CNN) based model, predicts the diagnosis for multiple speech segments, which are combined for the final prediction. Similarly, we use contextual embedding extracted from BERT concatenated with a CNN-generated embedding for classifying the transcript. The individual predictions of the two models are then combined to make the final classification. We also perform experiments to analyze the model performance when Automated Speech Recognition (ASR) system generated transcripts are used instead of manual transcription in the text-based model. The proposed method achieves 85.3% 10-fold cross-validation accuracy when trained and evaluated on the Dementiabank Pitt corpus.

研究の動機と目的

  • 音声とテキストトランスクリプトを用いたエンドツーエンドのマルチモーダル深層学習システムを開発し、早期アルツハイマー病の検出を実現すること。
  • AD分類におけるデータ不足を克服するための転移学習の有効性を評価すること。
  • 実用的導入を念頭に、手動トランスクリプトの代わりに ASR で生成されたトランスクリプトを用いる可能性を評価すること。
  • 年齢および性別に関するモデルの性能に及ぼすデモグラフィックバイアスを調査すること。
  • マルチモーダル統合戦略を比較し、AD検出に最適な音声およびテキスト特徴の組み合わせを同定すること。

提案手法

  • 複数の音声セグメントを処理する CNN に基づく音声ネットワークが、診断予測のための音声埋め込みを抽出する。
  • テキスト特徴は、文脈的および構文的分析のため、BERT 埋め込みと CNN で生成された埋め込みを連結することで抽出される。
  • 音声およびテキストブランチからの個別予測が、レイト統合により統合され、最終分類が得られる。
  • データ不足を緩和するため、音声およびテキストモデルに転移学習が適用され、事前学習済み表現が活用される。
  • システムは、手動および ASR で生成されたトランスクリプトを用いて、Dementiabank Pitt コーパスで 10 折り交差検証を実施して評価される。
  • 年齢群(86–95 歳)および性別ごとのバイアス分析が行われ、特異性、感度、正確度の差を評価する。

実験結果

リサーチクエスチョン

  • RQ1音声とテキストを統合するマルチモーダル深層学習モデルは、単一モーダル手法と比較して、AD 検出の正確度を向上させることができるか?
  • RQ2転移学習は、限られた AD データセット上でモデル性能を向上させるのにどの程度効果的か?
  • RQ3ASR で生成されたトランスクリプトは、正確度の著しい低下を伴わずに、手動トランスクリプトの代替としてどの程度利用可能か?
  • RQ4モデルは、特定の年齢層や性別に対してバイアスを示すか?
  • RQ5マルチモーダル AD 検出において、音声およびテキスト特徴を統合する最適な統合戦略は何か?

主な発見

  • 提案されたマルチモーダルモデルは、Dementiabank Pitt コーパスの手動トランスクリプトを用いて学習・評価した場合、85.3% の正確度と 84.4% の F1 スコアを達成した。
  • ASR で生成されたトランスクリプトを用いた場合、78.8% の正確度と 78.2% の F1 スコアを達成し、トランスクリプトの誤りがあっても実用的な妥当性を示した。
  • 86–95 歳の年齢群では、小規模なサンプルサイズと AD 以外の原因による発声障害の重複が原因で、正確度が 70.0% に低下した。
  • 性別バイアスは顕著に認められなかったが、男性の検出正確度が低かったのは、男性参加者が少ないことと、女性に比べて初期 AD 発症率が高いことが要因とされた。
  • 短い音声セグメントと手動トランスクリプトを除くすべての設定で、統合モデルは個別の音声およびテキストモデルを上回った。
  • 言語的マーカー(例:間投語や意味の不整合)を示すセグメントでは、ASR の誤りがあっても、AD 陽性例を高い信頼性(0.8 以上)で予測した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。