Skip to main content
QUICK REVIEW

[論文レビュー] Detecting Alzheimer's Disease Using Gated Convolutional Neural Network from Audio Data

Tifani Warnita, Nakamasa Inoue|arXiv (Cornell University)|Mar 30, 2018
Speech Recognition and Synthesis参考文献 21被引用数 6
ひとこと要約

本論文では、音声の書き取りや言語固有の言語的手がかりに依存せずに、音声特徴のみを用いてアルツハイマー病(AD)を検出する非言語的でゲート付き畳み込みニューラルネットワーク(GCNN)を提案する。この手法はピットコーパスで73.6%の精度を達成し、SMOを7.6ポイント上回り、発話レベルのセグメンテーションがなくても頑健であることを示している。

ABSTRACT

We propose an automatic detection method of Alzheimer's diseases using a gated convolutional neural network (GCNN) from speech data. This GCNN can be trained with a relatively small amount of data and can capture the temporal information in audio paralinguistic features. Since it does not utilize any linguistic features, it can be easily applied to any languages. We evaluated our method using Pitt Corpus. The proposed method achieved the accuracy of 73.6%, which is better than the conventional sequential minimal optimization (SMO) by 7.6 points.

研究の動機と目的

  • 音声音声のみを用いて、低リソースで言語に依存しないアルツハイマー病の早期検出手法を開発すること。
  • 感情認識で一般的に用いられる、抑揚や発声の質といった副言語的特徴を活用し、神経変性に伴う発声の変化を検出すること。
  • 時間的パターンを捉えるゲート付き畳み込みニューラルネットワークを採用することで、小規模データセットにおける性能を向上させること。
  • 発話境界が不明な状況でもモデルの頑健性を評価し、書き取りが不要な実世界への展開を可能にすること。
  • 言語に依存せず、チャネル変動やノイズ変動に強い音声のみのAD検出のベースラインを確立すること。

提案手法

  • ゲート付き畳み込みニューラルネットワーク(GCNN)は、音声音声から抽出した副言語的特徴を入力とし、openSMILEのIS10特徴セットを用いる。
  • ゲート機構により特徴マップを動的に調節し、低リソース環境下でも時間的パターンを的確に学習できる能力を向上させる。
  • ピットコーパスの音声データは、正規化、書き取りに基づく発話へのセグメンテーション、フェードイン/フェードアウト処理を経て前処理された。
  • データ漏洩や話者バイアスを最小限に抑えるために、被験者に重複がない10分割交差検証を採用した。
  • 被験者レベル分類のため、発話レベルの予測結果を多数決で統合した。
  • 発話境界が不明な状況での性能を評価するため、セグメンテーション長を500msから4295msまで変化させた。

実験結果

リサーチクエスチョン

  • RQ1音声特徴のみで学習したディーブラーニングモデルは、従来の手法(例:SMO)よりもアルツハイマー病の検出精度を向上させられるか?
  • RQ2CNNにゲート機構を組み込むことで、非言語的音声データセット(特に小規模)における分類性能が向上するか?
  • RQ3発話境界が不明な状況でもモデルの頑健性は保たれ、固定長の音声セグメントを用いても高い精度を維持できるか?
  • RQ4非言語的アプローチは、特に低リソース言語においても、書き取りを必要とせずに多言語に一般化可能か?
  • RQ5どの副言語的特徴セットが、音声におけるアルツハイマー病検出において最も優れた性能を示すか?

主な発見

  • 提案されたGCNNはピットコーパスで73.6%の精度を達成し、SMOベースラインを7.6ポイント上回った。
  • IS10特徴セットは、openSMILEのすべての構成の中で最良の性能を示し、特に発声確率およびジッター/シャイマーの表現が向上していた。
  • ゲート機構により、標準CNNの平均精度66.1%からGCNNの73.6%に向上し、時間的ダイナミクスをモデル化する有効性が示された。
  • 4000msの固定長セグメントを用いた10層GCNNでは69.8%の精度を達成し、オラクル発話境界を用いた72.2%に近く、高い性能を示した。
  • 発話境界を用いない状況でも高い性能を維持したため、書き取りが不要な実世界展開の可能性が示された。
  • 10層のGCNNとIS10特徴を組み合わせた構成が、全テスト設定の中で最高の精度(73.6%)を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。