[論文レビュー] Detecting COVID-19 from Breathing and Coughing Sounds using Deep Neural Networks
本稿では、スマートフォンを用いたCOVID-19のスクリーニングを目的として、呼吸音および咳音の生音声とスペクトログラムを用いた深層学習手法を提案する。モデルはベイズ最適化およびHyperBandを用いて最適化された畳み込みニューラルネットワークのアンサンブルを採用し、被験者に依存しないテストにおいて74.9%の未加重平均再現率(UAR)および80.7%のAUCを達成した。呼吸音の方が咳音よりも優れた性能を示した。
The COVID-19 pandemic has affected the world unevenly; while industrial economies have been able to produce the tests necessary to track the spread of the virus and mostly avoided complete lockdowns, developing countries have faced issues with testing capacity. In this paper, we explore the usage of deep learning models as a ubiquitous, low-cost, pre-testing method for detecting COVID-19 from audio recordings of breathing or coughing taken with mobile devices or via the web. We adapt an ensemble of Convolutional Neural Networks that utilise raw breathing and coughing audio and spectrograms to classify if a speaker is infected with COVID-19 or not. The different models are obtained via automatic hyperparameter tuning using Bayesian Optimisation combined with HyperBand. The proposed method outperforms a traditional baseline approach by a large margin. Ultimately, it achieves an Unweighted Average Recall (UAR) of 74.9%, or an Area Under ROC Curve (AUC) of 80.7% by ensembling neural networks, considering the best test set result across breathing and coughing in a strictly subject independent manner. In isolation, breathing sounds thereby appear slightly better suited than coughing ones (76.1% vs 73.7% UAR).
研究の動機と目的
- 発展途上国における診断資材やインfra整備の不足に起因するCOVID-19検査の格差を是正すること。
- 診断に必要な材料やインfraが限られる状況においても、広く利用可能なスマートフォンを活用した低コストで普遍的な事前スクリーニング手法の開発。
- 深層学習を用いて、呼吸音および咳音といった音声信号がCOVID-19感染の指標として有効であるかを検証すること。
- ベイズ最適化およびHyperBandによる自動化されたハイパーパrameterチューニングを活用し、検出精度を向上させること。
提案手法
- 深層学習モデルの入力特徴として、生音声および複数のスペクトログラム表現(異なるホップ長を用いて)を用いる。
- 生音声用とスペクトログラム用の2本のブランチを持つ二重分岐畳み込みニューラルネットワーク(CNN)アーキテクチャを採用。各ブランチは入力を独立して処理する。
- 各ブランチは、ReLU活性化関数を内蔵した1次元畳み込みブロックのスタック、マックスプーリング、20%のドロップアウトを含み、過学習を低減する。
- 時間的次元を低減するためにグローバル平均プーリングおよびマックスプーリングを適用し、その後、表現を連結して最終分類に用いる。
- 確率的勾配降下法を用いて個々のモデルを訓練し、早期停止およびL2正則化を適用。ハイパーパrameterはベイズ最適化およびHyperBandを用いて最適化。
- 性能が優れたモデルをアンサンブル化し、モデル平均を用いることで、被験者に依存しないテストセットにおける耐性および汎化性能を向上させる。
実験結果
リサーチクエスチョン
- RQ1深層ニューラルネットワークは、十分な精度で呼吸音および咳音からCOVID-19を検出可能であり、事前スクリーニングツールとしての役割を果たせるか?
- RQ2音声ベースの検出性能は、呼吸音と咳音のモダリティによってどのように変化するか?
- RQ3自動化されたハイパーパrameterチューニングは、未観測の被験者に対してモデルの汎化性能および性能をどの程度向上させるか?
- RQ4モデルアンサンブルは、異なるデータ分割に対して予測の安定性および信頼性をどの程度向上させるか?
主な発見
- 提案されたアンサンブルモデルは、被験者に依存する厳密なテストセットにおいて、74.9%の未加重平均再現率(UAR)および80.7%のROC曲線下の面積(AUC)を達成した。
- 呼吸音は76.1%のUARを示したのに対し、咳音は73.7%であった。これは、呼吸音がCOVID-19検出に向けたより特徴的な情報を含んでいる可能性を示唆している。
- 異なる交差検証のfold間でモデル性能に顕著な差が認められ、個々のモデルでは標準偏差が高くなる傾向にあり、データ分割および初期化に敏感であることが示された。
- アンサンブルモデルでは、UARおよびAUCの両方で最小の標準偏差を示し、個々のモデルと比較してより高い安定性および耐性を示した。
- 結果から、音声ベースの検出は低コストな事前スクリーニング手法として実現可能であるが、現在のデータセットが小さい(オリジナルのサンプルが2時間分)ため、性能に限界があることが示された。
- 今後のデータ収集では、より多くの呼吸音記録を優先し、他の呼吸器疾患を有する多様な対照群を含めることで、モデルの汎化性能および診断的有用性を向上させるべきである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。