[論文レビュー] Machine Learning based COVID-19 Detection from Smartphone Recordings: Cough, Breath and Speech
本研究では、機械学習を用いて咳、息、発声の記録を分析することで、スマートフォンベースの非侵襲的COVID-19検出システムを提案する。CoswaraおよびComParEのデータセットを用い、咳ではKNNとSFSを組み合わせた場合、AUCが0.93に達し、息ではResNet50を用いた場合、AUCが0.92に達した。これは、咳に特に注目すべきCOVID-19の兆候が、人間の耳では聞き取れないが、音声に内在していることを示している。
We present an experimental investigation into the automatic detection of COVID-19 from smartphone recordings of coughs, breaths and speech. This type of screening is attractive because it is non-contact, does not require specialist medical expertise or laboratory facilities and can easily be deployed on inexpensive consumer hardware. We base our experiments on two datasets, Coswara and ComParE, containing recordings of coughing, breathing and speech from subjects around the globe. We have considered seven machine learning classifiers and all of them are trained and evaluated using leave-p-out cross-validation. For the Coswara data, the highest AUC of 0.92 was achieved using a Resnet50 architecture on breaths. For the ComParE data, the highest AUC of 0.93 was achieved using a k-nearest neighbours (KNN) classifier on cough recordings after selecting the best 12 features using sequential forward selection (SFS) and the highest AUC of 0.91 was also achieved on speech by a multilayer perceptron (MLP) when using SFS to select the best 23 features. We conclude that among all vocal audio, coughs carry the strongest COVID-19 signature followed by breath and speech. Although these signatures are not perceivable by human ear, machine learning based COVID-19 detection is possible from vocal audio recorded via smartphone.
研究の動機と目的
- スマートフォンで録音した音声のみを用いて、低コストで非接触的かつスケーラブルなCOVID-19検出手法を開発すること。
- 咳、息、発声の音声からCOVID-19を同定する際の、さまざまな機械学習モデルの有効性を評価すること。
- SARS-CoV-2感染を同定するうえで、咳、息、発声といった異なる音声モodalitiy(音声モodalitiy)の診断的潜在能力を比較すること。
- 最も情報量の多い音声特徴を同定し、特徴選択技術を用いてモデル性能を最適化すること。
- 公開済みのデータセット(CoswaraおよびComParE)を用いて、多様な世界的な集団への一般化可能性を評価すること。
提案手法
- 多様な被験者サブセットにわたるモデル評価を確実にするために、leave-p-out交差検証を採用する。
- CoswaraおよびComParEデータセットの音声記録を用い、ResNet50、KNN、MLPを含む7種類の機械学習分類器を訓練および評価する。
- 生の音声から最も判別能の高い特徴を同定するために、逐次前進選択(SFS)を用い、モデルの一般化性能を向上させる。
- 咳、息、発声のサンプルから特徴を抽出し、複雑なパターン検出のため、生のスペクトログラムに深層学習(ResNet50)を適用する。
- 医療診断における二値分類の標準指標として、受信者操作特性曲線下の面積(AUC)を用いて性能を評価する。
- 異なる音声タイプ(咳、息、発声)およびデータセット間でのモデル性能を比較し、最も情報量の多いモダリティを特定する。
実験結果
リサーチクエスチョン
- RQ1スマートフォンで録音した音声において、咳、息、発声のうち、どの音声モダリティがCOVID-19の最も顕著な検出可能な兆候を含んでいるか?
- RQ2どの機械学習モデルが、音声記録からのCOVID-19検出において最高の診断性能(AUC)を達成するか?
- RQ3特徴選択(例:SFS)は、このタスクにおける機械学習モデルの性能をどのように向上させるか?
- RQ4軽量で一般消費者向けのスマートフォンシステムは、臨床的専門知識や研究所施設を必要とせずに、COVID-19を信頼性高く検出できるか?
- RQ5CoswaraおよびComParEのような多様な世界的なデータセットにおいて、モデルの性能と一般化能力はどのように変動するか?
主な発見
- 咳の記録が最も高い診断的性能を示し、特徴選択を施したk近傍法(KNN)分類器を用いることでAUCが0.93に達した。
- 息の記録は2番目に高い結果を示し、CoswaraデータセットでResNet50アーキテクチャを用いることでAUCが0.92に達した。
- 発声の記録では、逐次前進選択で最良の23個の特徴を選択した多層パーセプトロン(MLP)を用いることでAUCが0.91に達した。
- 本研究では、特に咳に注目すべき、人間の耳では聞こえないが、機械で検出可能なCOVID-19の兆候が音声に内在していることが確認された。
- 特徴選択は、特に高次元の音声空間においてモデル性能を顕著に向上させ、診断精度を最適化するうえで極めて重要であることが示された。
- スマートフォンを用いた非侵襲的スクリーニングが、集団レベルのCOVID-19検出において実用的で、スケーラブルかつ高精度なアプローチであることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。