Skip to main content
QUICK REVIEW

[論文レビュー] Developing a multi-variate prediction model for the detection of COVID-19 from Crowd-sourced Respiratory Voice Data

Wafaa Aljbawi, Sami O. Simmons|arXiv (Cornell University)|Sep 8, 2022
COVID-19 diagnosis using AI被引用数 11
ひとこと要約

本研究では、一般住民から収集したボイスレコーディングを用いて、非侵襲的にCOVID-19を検出する深層学習モデルを開発した。MFCC(メル周波数 cepstral コefficients)を用いてトレーニングされたLSTMネットワークにより、89%の正確性、89%の感度、89%の特異性を達成し、従来の機械学習モデルを上回り、リソースが限られた環境におけるスケーラブルで低コストな診断法として強い可能性を示した。

ABSTRACT

COVID-19 has affected more than 223 countries worldwide. There is a pressing need for non invasive, low costs and highly scalable solutions to detect COVID-19, especially in low-resource countries where PCR testing is not ubiquitously available. Our aim is to develop a deep learning model identifying COVID-19 using voice data recordings spontaneously provided by the general population (voice recordings and a short questionnaire) via their personal devices. The novelty of this work is in the development of a deep learning model for the identification of COVID-19 patients from voice recordings. Methods: We used the Cambridge University dataset consisting of 893 audio samples, crowd-sourced from 4352 participants that used a COVID-19 Sounds app. Voice features were extracted using a Mel-spectrogram analysis. Based on the voice data, we developed deep learning classification models to detect positive COVID-19 cases. These models included Long-Short Term Memory (LSTM) and Convolutional Neural Network (CNN). We compared their predictive power to baseline classification models, namely Logistic Regression and Support Vector Machine. Results: LSTM based on a Mel-frequency cepstral coefficients (MFCC) features achieved the highest accuracy (89%,) with a sensitivity and specificity of respectively 89% and 89%, The results achieved with the proposed model suggest a significant improvement in the prediction accuracy of COVID-19 diagnosis compared to the results obtained in the state of the art. Conclusion: Deep learning can detect subtle changes in the voice of COVID-19 patients with promising results. As an addition to the current testing techniques this model may aid health professionals in fast diagnosis and tracing of COVID-19 cases using simple voice analysis

研究の動機と目的

  • 一般住民のボイスレコーディングを用いて、非侵襲的で低コストかつスケーラブルなCOVID-19検出法を開発すること。
  • 従来の機械学習モデル(ロジスティック回帰、SVM)と比較して、深層学習モデル(LSTM、CNN)がボイスデータからのCOVID-19状態分類にどの程度効果的であるかを評価すること。
  • クラウドソーシングされた音声データを用いてSARS-CoV-2感染を正確に検出するための、最も効果的な音声特徴とモデルアーキテクチャを同定すること。
  • 特にリソースが限られた環境において、PCR検査や迅速抗原検査と併用可能な音声分析の実用可能性を検討すること。

提案手法

  • COVID-19 Soundsアプリを介して4,352名の参加者から893件のボイスレコーディングを収集し、ボイスレコーディングと自己申告された健康データを含むマルチモodalデータセットを構築した。
  • 音声のスペクトル的および時間的パターンを表現するために、メルスペクトログラムおよびメル周波数ケプストラル係数(MFCC)を用いて音声特徴を抽出した。
  • ボイスレコーディングからのCOVID-19陽性/陰性の二値分類を目的とした、長短期記憶(LSTM)および畳み込みニューラルネットワーク(CNN)の深層学習モデルをトレーニングおよび比較した。
  • 比較のため、人口統計、症状、臨床データを用いたベースライン機械学習モデル(ロジスティック回帰、サポートベクターマシン(SVM))を評価した。
  • 感度、特異度、全体の正確性に注目し、モデルのパフォーマンスを評価するために、混同行列、受信者操作特性曲線(ROC)、AUCスコアを用いた。
  • 妥当性指標および外部妥当性の可能性に基づき、最も優れたパフォーマンスを示したモデルを選定した。

実験結果

リサーチクエスチョン

  • RQ1クラウドソーシングされたボイスデータを用いた音声ベースの深層学習モデルは、高い感度と特異度でCOVID-19を検出できるか?
  • RQ2MFCC特徴量でトレーニングされたLSTMモデルは、CNN、ロジスティック回帰、SVMモデルと比較して、COVID-19検出においてどの程度のパフォーマンスを示すか?
  • RQ3自発的発話レコーディングにおいて、COVID-19状態を最も効果的に予測する音声特徴(例:MFCC、メルスペクトログラム)は何か?
  • RQ4音声分析は、リソースが限られた環境において、PCR検査や迅速抗原検査の代替としてどの程度スケーラブルで低コストに実現可能か?

主な発見

  • MFCC特徴量でトレーニングされたLSTMモデルは、ボイスレコーディングからのCOVID-19検出において、89%の正確性、89%の感度、89%の特異度を達成し、最も高い全体的なパフォーマンスを示した。
  • CNNモデルは80%の感度と80%の特異度を示し、メルスペクトログラム画像からの特徴量学習が効果的であることを示した。
  • ロジスティック回帰およびSVMモデルは、それぞれ70%の感度と80%の特異度を達成し、依然として妥当な性能を示したが、このタスクにおける従来のモデルの限界を示した。
  • LSTMモデルのROC曲線は高いAUCを示し、陽性例と陰性例の分類能力が優れていることを裏付けた。
  • 本研究は、特にLSTMを含む深層学習モデルが、SARS-CoV-2感染に起因する呼吸機能障害に関連する微細な発声変化を検出可能であることを確認した。
  • 結果から、音声分析は、PCR検査へのアクセスが限られる環境において、早期検出および接触者追跡のための実用的で非侵襲的かつスケーラブルなツールとして機能可能であると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。