Skip to main content
QUICK REVIEW

[論文レビュー] Combining Prosodic, Voice Quality and Lexical Features to Automatically Detect Alzheimer's Disease

Mireia Farrús, Joan Codina|arXiv (Cornell University)|Nov 18, 2020
Speech Recognition and Synthesis参考文献 30被引用数 5
ひとこと要約

本論文は、アルツハイマー病(AD)の検出およびミニメンタルステートテスト(MMSE)スコアの予測のために、自然な会話からのプロソディック特徴、ボイス・クオリティ特徴、語彙的特徴を組み合わせたマルチモーダル機械学習手法を提案する。108名のバランスの取れた参加者を対象にランダムフォレスト分類器を用いた結果、分類精度は87.5%、回帰のRMSEは4.54を達成し、音声特徴のみを用いる手法に比べ、語彙的およびプロソディック特徴が早期AD検出において顕著に寄与することが示された。

ABSTRACT

Alzheimer's Disease (AD) is nowadays the most common form of dementia, and its automatic detection can help to identify symptoms at early stages, so that preventive actions can be carried out. Moreover, non-intrusive techniques based on spoken data are crucial for the development of AD automatic detection systems. In this light, this paper is presented as a contribution to the ADReSS Challenge, aiming at improving AD automatic detection from spontaneous speech. To this end, recordings from 108 participants, which are age-, gender-, and AD condition-balanced, have been used as training set to perform two different tasks: classification into AD/non-AD conditions, and regression over the Mini-Mental State Examination (MMSE) scores. Both tasks have been performed extracting 28 features from speech -- based on prosody and voice quality -- and 51 features from the transcriptions -- based on lexical and turn-taking information. Our results achieved up to 87.5 % of classification accuracy using a Random Forest classifier, and 4.54 of RMSE using a linear regression with stochastic gradient descent over the provided test set. This shows promising results in the automatic detection of Alzheimer's Disease through speech and lexical features.

研究の動機と目的

  • 非侵襲的で音声ベースの手法を用いて、アルツハイマー病(AD)の早期検出を改善すること。
  • プロソディック特徴、ボイス・クオリティ特徴、語彙的特徴の有効性が、AD患者と非AD個体を区別する上で果たす役割を調査すること。
  • 自発的会話データを活用することで、AD検出システムにおける標準化の欠如を是正すること。
  • 統一された特徴セットを用いて、分類(AD/非AD)および回帰(MMSEスコア予測)の両タスクを評価すること。
  • 音声特徴のみを用いるアプローチに比べ、音声的および言語的特徴を統合した手法がAD検出において優れていることを示すこと。

提案手法

  • 音声信号から、話速、ジッター、シャイマー、調和性などを含む28のプロソディックおよびボイス・クオリティ特徴を抽出した。
  • 音声の字幕化結果から、語彙頻度、話者交代の長さ、インタビュアーの干渉回数などを含む51の語彙的および話者交代特徴を抽出した。
  • AD群と非AD群の間に有意差を示す特徴を同定するためにt検定を用いた統計的分析を行った。
  • ランダムフォレスト、SVM、MLP、勾配降下法を用いた線形回帰を含む複数の機械学習モデルを訓練した。
  • モデル評価には10分割交差検証を用い、統計的有意性に基づく特徴選択を実施した。
  • 最終的なモデル学習の前に、MMSEの外れ値をデータセットから削除することで結果を改善した。

実験結果

リサーチクエスチョン

  • RQ1自発的会話からのプロソディック特徴およびボイス・クオリティ特徴は、アルツハイマー病(AD)を有する個体と健康な対照群を効果的に区別できるか?
  • RQ2語彙的および話者交代特徴は、AD分類およびMMSE回帰の精度向上にどの程度寄与するか?
  • RQ3音声的特徴と言語的特徴を統合した手法は、それぞれのモダリティを個別に用いる場合に比べ、AD検出においてどのように優れているか?
  • RQ4外れ値除去などのデータ前処理は、AD検出タスクにおけるモデル性能にどのような影響を与えるか?
  • RQ5ASRや手動による字幕化に依存せずに、言語に依存しない音声特徴が、高い性能を発揮できるか?

主な発見

  • ランダムフォレスト分類器は、すべてのプロソディック特徴、ボイス・クオリティ特徴、語彙的特徴を統合した場合、最高の分類精度87.5%を達成した。
  • 勾配降下法を用いた線形回帰モデルは、テストセットにおいてMMSEスコア予測でRMSE 4.54を達成した。
  • 語彙的および話者交代特徴は、音声特徴のみを用いる手法に比べ、特に偽陰性の削減において顕著に優れていた。
  • すべての特徴タイプを統合した場合、分類および回帰の両タスクで最高の性能が得られた。
  • MMSEの外れ値を削除することで、最高性能を示したシステムの性能が向上した。これは、データ品質が結果に与える影響を示している。
  • 音声特徴のみを用いたシステムは最大72.2%の精度を達成しており、ASRや字幕化に依存せずに、言語に依存しないAD検出が有望であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。