Skip to main content
QUICK REVIEW

[論文レビュー] Audio, Speech, Language, & Signal Processing for COVID-19: A Comprehensive Overview

Gauri Deshpande, Björn W. Schuller|arXiv (Cornell University)|Nov 29, 2020
COVID-19 diagnosis using AI被引用数 5
ひとこと要約

本論文は、COVID-19スクリーニング、診断、モニタリング、啓発に向けたAI駆動の音声・スピーチ・信号処理技術について包括的なレビューを提供している。MFCC、NMF、ディープラーニングモデルなどの音声および音声特徴を活用し、咳、呼吸の不規則さ、心理的ストレスといった呼吸器症状を検出しており、咳に基づく検出では最大91.6%のAUCを達成し、眠気および抑うつ状態予測においても有望な相関スコアを示している。

ABSTRACT

The Coronavirus (COVID-19) pandemic has been the research focus world-wide in the year 2020. Several efforts, from collection of COVID-19 patients' data to screening them for the virus's detection are taken with rigour. A major portion of COVID-19 symptoms are related to the functioning of the respiratory system, which in-turn critically influences the human speech production system. This drives the research focus towards identifying the markers of COVID-19 in speech and other human generated audio signals. In this paper, we give an overview of the speech and other audio signal, language and general signal processing-based work done using Artificial Intelligence techniques to screen, diagnose, monitor, and spread the awareness aboutCOVID-19. We also briefly describe the research related to detect accord-ing COVID-19 symptoms carried out so far. We aspire that this collective information will be useful in developing automated systems, which can help in the context of COVID-19 using non-obtrusive and easy to use modalities such as audio, speech, and language.

研究の動機と目的

  • COVID-19と闘うために、音声・スピーチ・信号処理に基づくAI研究を統合し分析すること。
  • 音声および音声信号を用いた非侵襲的で低コストかつスケーラブルなスクリーニングおよびモニタリング手法を同定すること。
  • 計算的パラリンギスティクスおよび感情的コンピューティングがパンデミック期におけるストレス、不安、抑うつ状態の検出において果たす役割を評価すること。
  • 現在の研究におけるギャップを明確にし、自動的で信頼性が高く、臨床的に整合性のあるツールの今後の開発を導くこと。
  • スピーチベースのシステムをチャットボットおよびデジタルヘルスプラットフォームと統合し、公衆衛生への影響を高めること。

提案手法

  • 音声およびスピーチ処理を用いたCOVID-19アプリケーションに関する100件以上の研究を対象とした体系的レビュー。
  • XGBoost、SVM、アテンションベースのネットワークなどの機械学習およびディープラーニングモデルを音声および音声データセットに適用。
  • メル周波数ケプストラム係数(MFCC)、非負値行列分解(NMF)、ガマトーン周波数ケプストラム係数(GFCC)を含む信号処理技術の使用。
  • 回帰および分類の精度向上のため、フィッシャー特徴量、音声ワードのBag of (BoAW)、アテンション機構を含む高度な特徴表現の活用。
  • ネットワークプリンニングおよび量子化によるモデル最適化により、性能に損なわれることなくモデルサイズを95%削減。
  • ストレスおよび眠気検出に使用する既存のデータセット(DAICWOZおよびInterspeech 2019チャレンジデータ)の活用。

実験結果

リサーチクエスチョン

  • RQ1音声および音声信号は、咳や呼吸パターンの異常といったCOVID-19の早期兆候を信頼性を持って検出できるか?
  • RQ2音声特徴を用いた機械学習モデルは、他の呼吸器疾患と区別してCOVID-19関連の咳をどれほど効果的に特定できるか?
  • RQ3パンデミック下のストレス状態にある個人において、音声および音声処理は心理的苦痛、疲労、眠気をどの程度検出できるか?
  • RQ4公衆衛生危機の際、実用的でスケーラブルかつプライバシーに配慮した音声ベースのスクリーニングシステムを展開するにあたり、主な課題は何か?
  • RQ5スピーチおよび言語処理をチャットボットと統合することで、公衆衛生啓発を強化し、誤情報の拡散を減らすにはどうすればよいか?

主な発見

  • 12個のMFCCとXGBoostを用いた咳音検出はAUCが0.916に達し、強力な診断可能性を示している。
  • NMFベースの特徴抽出は、従来のMFCCやGFCCなどの特徴と比較して、正答率、再現率、F1スコアをそれぞれ1%向上させた。
  • COMPARE特徴量とフィッシャー特徴量を用いた眠気検出は、950名の被験者からなるデータセットでスピアマンの順位相関係数0.383を達成した。
  • DAICWOZデータセットを用いた階層的アテンション転送ネットワークによる抑うつ状態予測では、RMSEが5.66、MAEが4.28であった。
  • モデル圧縮技術により、ディープラーニングモデルのサイズを95%削減しながら性能に損なわれることなく、デバイス内での実装が可能になった。
  • スピーチベースのスクリーニングをチャットボットと統合することで、人的介入を削減し、公衆衛生モニタリングにおけるスケーラビリティを向上させることができる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。