Skip to main content
QUICK REVIEW

[論文レビュー] Identification of Dementia Using Audio Biomarkers

Rupayan Chakraborty, Meghna Pandharipande|arXiv (Cornell University)|Feb 27, 2020
Music and Audio Processing参考文献 23被引用数 8
ひとこと要約

本論文では、臨床医と患者の会話から得られる非言語的音響特徴のみを用いて、言語に依存しない音響バイオマーカーに基づくアプローチを提案し、健康対照群(HC)、軽度認知障害(MCI)、アルツハイマー病(AD)の認知症ステージを分類する。複数の音響特徴タイプ(スペクトル、時間的、ケプストラル)のスコアレベル融合とデータバランス化を採用することで、特徴レベル融合よりも5%の絶対的向上を達成し、82%の正確性を示した。これは、特に挑戦的なMCI分類に対しても堅牢な性能を発揮することを示している。

ABSTRACT

Dementia is a syndrome, generally of a chronic nature characterized by a deterioration in cognitive function, especially in the geriatric population and is severe enough to impact their daily activities. Early diagnosis of dementia is essential to provide timely treatment to alleviate the effects and sometimes to slow the progression of dementia. Speech has been known to provide an indication of a person's cognitive state. The objective of this work is to use speech processing and machine learning techniques to automatically identify the stage of dementia such as mild cognitive impairment (MCI) or Alzheimers disease (AD). Non-linguistic acoustic parameters are used for this purpose, making this a language independent approach. We analyze the patients audio excerpts from a clinician-participant conversations taken from the Pitt corpus of DementiaBank database, to identify the speech parameters that best distinguish between MCI, AD and healthy (HC) speech. We analyze the contribution of various types of acoustic features such as spectral, temporal, cepstral their feature-level fusion and selection towards the identification of dementia stage. Additionally, we compare the performance of using feature-level fusion and score-level fusion. An accuracy of 82% is achieved using score-level fusion with an absolute improvement of 5% over feature-level fusion.

研究の動機と目的

  • 音声からのみの音響特徴を用いて、言語に依存せず、非侵襲的な認知症ステージ分類法を開発すること。
  • HC、MCI、ADを区別するのに最も特徴的な音響バイオマーカー(スペクトル、時間的、ケプストラル)を特定すること。
  • 分類性能の向上を図るため、初期融合(特徴レベル)と遅延融合(スコアレベル)の戦略を比較すること。
  • MCIに特に顕著なクラス不均衡を是正することで、モデルの頑健性と正確性を向上させること。
  • 言語的または音声の書き起こし内容に依存せずに、音声の音響のみを用いて、多クラス認知症ステージ分類の高精度を達成すること。

提案手法

  • ピット認知症バンクコロナスの音声断片から、非言語的音響特徴(スペクトル、時間的、ケプストラル、およびそれらの組み合わせ)を抽出した。
  • 特徴レベル融合を実装し、複数の音響特徴タイプを分類の前に連結することで、単一の特徴ベクトルを形成した。
  • スコアレベル融合を実装し、個々の特徴セットに別々に訓練した分類器の後方確率を2つの方法で統合した:(1) 後方確率の合計のargmax、(2) 重み付き後方確率平均のargmax。
  • SMO、MLP、BayesNet、SimpleLogisticなどの複数の分類器を用い、初期融合および遅延融合の両方の構成で性能を評価した。
  • リサンプリング技術を用いて、HC、MCI、ADの各クラス間でデータセットをバランス化し、クラス不均衡の是正とMCI分類の向上を図った。
  • 全体の正確性を主指標として、すべての3クラスで適合率、再現率、Fスコアを評価した。

実験結果

リサーチクエスチョン

  • RQ1スペクトル、時間的、ケプストラルのどの音響特徴タイプが、HC、MCI、ADの音声を区別するのに最も効果的か?
  • RQ2複数の音響特徴セットのスコアレベル融合は、特徴レベル融合よりも認知症ステージ分類において優れているか?
  • RQ3特にMCIに顕著なクラス不均衡は分類性能にどのように影響し、バランス化によって結果が改善されるか?
  • RQ4言語に依存せず、非言語的アプローチで、音声の音響のみを用いて多クラス認知症ステージ分類に高い正確性を達成できるか?
  • RQ5分類正確性を最大化するために、最適な音響バイオマーカーの組み合わせと融合戦略は何か?

主な発見

  • スコアレベル融合にデータバランス化を組み合わせた結果、全体の正確性が82%に達し、特徴レベル融合の82%よりも5%の絶対的向上を示した。
  • 最も優れた性能を示した設定は、バランス化済みデータ上でSMO分類器を用いたスコアレベル融合で、全体のFスコアが82%に達した。
  • MCI分類は依然として最も困難なクラスであり、データバランス化後でもほとんどの設定でFスコアが60%未満にとどまった。
  • 特徴レベル融合により、ベースラインの66%(正確性)からFスコアが77%に向上し、多様な音響特徴の統合の価値を示した。
  • データバランス化は、すべての分類器において顕著に性能向上をもたらし、特にMCIにおいて顕著であった。これは、初期の結果においてクラス不均衡が主要な混同要因であったことを示している。
  • 提案手法は、音響バイオマーカーのみを用いて82%の高精度を達成した。これは、言語に依存せず、非侵襲的な認知症ステージ分類に有効であることを実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。