Skip to main content
QUICK REVIEW

[论文解读] Detecting COVID-19 from Breathing and Coughing Sounds using Deep Neural Networks

Björn W. Schuller, Harry Coppock|arXiv (Cornell University)|Dec 29, 2020
COVID-19 diagnosis using AI参考文献 17被引用 16
一句话总结

本文提出一种基于原始音频和呼吸声与咳嗽声频谱图的深度学习方法,通过移动设备检测COVID-19,采用贝叶斯优化与HyperBand联合优化的卷积神经网络集成模型。在严格意义上的受试者独立测试中,该方法实现了74.9%的未加权平均召回率(UAR)和80.7%的AUC,其中呼吸声的表现优于咳嗽声。

ABSTRACT

The COVID-19 pandemic has affected the world unevenly; while industrial economies have been able to produce the tests necessary to track the spread of the virus and mostly avoided complete lockdowns, developing countries have faced issues with testing capacity. In this paper, we explore the usage of deep learning models as a ubiquitous, low-cost, pre-testing method for detecting COVID-19 from audio recordings of breathing or coughing taken with mobile devices or via the web. We adapt an ensemble of Convolutional Neural Networks that utilise raw breathing and coughing audio and spectrograms to classify if a speaker is infected with COVID-19 or not. The different models are obtained via automatic hyperparameter tuning using Bayesian Optimisation combined with HyperBand. The proposed method outperforms a traditional baseline approach by a large margin. Ultimately, it achieves an Unweighted Average Recall (UAR) of 74.9%, or an Area Under ROC Curve (AUC) of 80.7% by ensembling neural networks, considering the best test set result across breathing and coughing in a strictly subject independent manner. In isolation, breathing sounds thereby appear slightly better suited than coughing ones (76.1% vs 73.7% UAR).

研究动机与目标

  • 解决全球COVID-19检测能力的不平等,特别是在缺乏诊断材料和基础设施的发展中国家。
  • 开发一种低成本、普适的预测试方法,利用广泛可用的移动设备在确诊检测前识别潜在的COVID-19病例。
  • 探索利用音频信号(特别是呼吸声和咳嗽声)作为COVID-19感染指标的可行性,通过深度学习实现。
  • 通过集成模型和基于贝叶斯优化与HyperBand的自动化超参数调优,提升检测准确性。

提出的方法

  • 将原始音频和多种频谱图表示(不同帧移长度)作为深度学习模型的输入特征。
  • 采用双分支卷积神经网络(CNN)架构:一个分支处理原始音频,另一个分支处理频谱图,两个分支独立处理输入。
  • 每个分支由一系列1D卷积块组成,包含ReLU激活函数、最大池化和20%的Dropout,以减少过拟合。
  • 应用全局平均池化和最大池化以减少时间维数,随后在分类前拼接不同表示特征。
  • 使用随机梯度下降进行模型训练,配合早停法和L2正则化,通过贝叶斯优化与HyperBand自动调优超参数。
  • 通过模型平均法集成表现最佳的模型,以提升在受试者独立测试集上的鲁棒性和泛化能力。

实验结果

研究问题

  • RQ1深度神经网络能否以足够高的准确率从呼吸声和咳嗽声中检测出COVID-19,作为预筛查工具?
  • RQ2基于音频的检测性能在呼吸声与咳嗽声两种模态之间有何差异?
  • RQ3自动化超参数调优在多大程度上提升了模型在未见受试者上的泛化能力和性能?
  • RQ4模型集成在不同数据划分下如何影响预测的稳定性和可靠性?

主要发现

  • 所提出的集成模型在严格意义上的受试者独立测试集中实现了74.9%的未加权平均召回率(UAR)和80.7%的ROC曲线下面积(AUC)。
  • 呼吸声的UAR达到76.1%,高于咳嗽声的73.7%,表明呼吸声可能包含更多用于COVID-19检测的判别性特征。
  • 不同交叉验证折之间的模型性能差异显著,个体模型表现出较高的标准差,表明对数据划分和初始化较为敏感。
  • 集成模型在UAR和AUC上的标准差最低,表明其相比个体模型具有更高的稳定性和鲁棒性。
  • 结果表明,基于音频的检测作为低成本预筛查方法是可行的,但性能受限于当前数据集规模较小(原始样本仅两小时)。
  • 未来数据收集应优先增加更多呼吸声记录,并纳入其他呼吸道疾病患者的多样化对照组,以提升模型的泛化能力和诊断实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。