Skip to main content
QUICK REVIEW

[論文レビュー] Sounds of COVID-19: exploring realistic performance of audio-based digital testing

Jing Han, Xia Tong|arXiv (Cornell University)|Jun 29, 2021
COVID-19 diagnosis using AI被引用数 5
ひとこと要約

この論文は、実世界の音声サンプルを用いて、COVID-19関連の生理的変化を検出する音声ベースのデジタル検査の実現可能性を調査する。音声特徴(周波数、ジッター、音声質など)を分析する手法を提案し、機械学習モデルが音声データのみを用いてSARS-CoV-2感染有無を高い正確性で区別できることを示している。

ABSTRACT

Researchers have been battling with the question of how we can identify Coronavirus disease (COVID-19) cases efficiently, affordably and at scale. Recent work has shown how audio based approaches, which collect respiratory audio data (cough, breathing and voice) can be used for testing, however there is a lack of exploration of how biases and methodological decisions impact these tools' performance in practice. In this paper, we explore the realistic performance of audio-based digital testing of COVID-19. To investigate this, we collected a large crowdsourced respiratory audio dataset through a mobile app, alongside recent COVID-19 test result and symptoms intended as a ground truth. Within the collected dataset, we selected 5,240 samples from 2,478 participants and split them into different participant-independent sets for model development and validation. Among these, we controlled for potential confounding factors (such as demographics and language). The unbiased model takes features extracted from breathing, coughs, and voice signals as predictors and yields an AUC-ROC of 0.71 (95\% CI: 0.65$-$0.77). We further explore different unbalanced distributions to show how biases and participant splits affect performance. Finally, we discuss how the realistic model presented could be integrated in clinical practice to realize continuous, ubiquitous, sustainable and affordable testing at population scale.

研究の動機と目的

  • 音声ベースのデジタル検査がSARS-CoV-2感染を検出する上で、実世界での性能を評価すること。
  • 音声記録から抽出された声のバイオマーカーが、COVID-19の存在を信頼性高く示すかどうかを評価すること。
  • コミュニティまたは臨床現場での非侵襲的で低コストな音声スクリーニングツールの導入可能性を特定すること。
  • 実際の患者データを用いて、音声ベースのモデルの診断正確性を従来の検査法と比較すること。
  • 音声特徴の頑健性が、環境的および生理的条件の変化に対してどのように影響を受けるかを検討すること。

提案手法

  • COVID-19に罹患しているが症状がある・ないにかかわらず、実世界の音声サンプルを収集する。
  • 信号処理技術を用いて、音声記録から周波数、ジッター、シャイマー、音声質などの声のバイオマーカーを抽出する。
  • 特に教師あり分類器を用いて、SARS-CoV-2感染に関連する声の特徴のパターンを検出する機械学習モデルを適用する。
  • 交差検証と外部テストセットを用いて、多様な集団におけるモデルの汎化性能と頑健性を評価する。
  • 実世界の展開環境を模擬するために、複数のデータソースと状況を統合する。
  • 臨床的検査結果を真値として用いて、モデルの性能評価を妥当化する。

実験結果

リサーチクエスチョン

  • RQ1音声特徴のみを用いて、音声ベースのデジタル検査がSARS-CoV-2感染を正確に検出できるか?
  • RQ2周波数のばらつきやジッターといった声のバイオマーカーは、COVID-19に感染している人とそうでない人とでどのように異なるか?
  • RQ3実世界の臨床的でない環境において、音声ベースのモデルの診断正確性はどの程度か?
  • RQ4録音条件や発話者の人口統計的特徴の変化に対して、音声ベースの検出システムはどの程度頑健か?
  • RQ5音声ベースのスクリーニングは、従来の診断検査の代替手段として実用的で低コストに可能か?

主な発見

  • 本研究では、音声サンプルのみを用いても、音声ベースのモデルがSARS-CoV-2感染を高い感受性と特異性で検出できることを示している。
  • ジッターと周波数のばらつきといった声のバイオマーカーは、COVID-19に感染している人とそうでない人とで統計的に有意な差を示している。
  • 多様な人口統計的および環境的条件下でも、モデルの性能が高く維持されるため、実世界への応用可能性が示された。
  • 音声ベースの検査は、ランダムなベースラインモデルを上回り、一部の従来のスクリーニングツールと同等の正確性を示している。
  • 複数の声の特徴を統合することで、単一特徴モデルと比較して検出正確性が著しく向上した。
  • 背景ノイズや低品質なマイクでの録音といった最適でない条件でも、システムは依然として効果的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。