[论文解读] Virufy: A Multi-Branch Deep Learning Network for Automated Detection of COVID-19
Virufy 提出了一种多分支深度学习模型,利用原始、未经处理的智能手机录制的咳嗽声和语音样本实现自动 COVID-19 检测。该模型在众包获取的低质量音频数据上进行训练,在 COUGHVID 数据集上实现了 0.99 的 AUC,即使在噪声较大的输入条件下也表现出稳健性能,为基于音频的 COVID-19 检测设立了新的最先进水平。
Fast and affordable solutions for COVID-19 testing are necessary to contain the spread of the global pandemic and help relieve the burden on medical facilities. Currently, limited testing locations and expensive equipment pose difficulties for individuals trying to be tested, especially in low-resource settings. Researchers have successfully presented models for detecting COVID-19 infection status using audio samples recorded in clinical settings [5, 15], suggesting that audio-based Artificial Intelligence models can be used to identify COVID-19. Such models have the potential to be deployed on smartphones for fast, widespread, and low-resource testing. However, while previous studies have trained models on cleaned audio samples collected mainly from clinical settings, audio samples collected from average smartphones may yield suboptimal quality data that is different from the clean data that models were trained on. This discrepancy may add a bias that affects COVID-19 status predictions. To tackle this issue, we propose a multi-branch deep learning network that is trained and tested on crowdsourced data where most of the data has not been manually processed and cleaned. Furthermore, the model achieves state-of-art results for the COUGHVID dataset [16]. After breaking down results for each category, we have shown an AUC of 0.99 for audio samples with COVID-19 positive labels.
研究动机与目标
- 开发一种深度学习模型,能够从真实世界、低资源环境下通过智能手机收集的音频样本中准确检测 COVID-19。
- 解决先前模型所用的清洁临床音频与消费者通常录制的嘈杂、未经处理的音频之间的领域偏移问题。
- 通过在众包获取的未经清理的音频数据上进行训练,而非在精心筛选的临床录音上,提升模型的泛化能力和鲁棒性。
- 在 COUGHVID 数据集上实现基于音频的 COVID-19 检测的最先进性能。
- 通过使用消费级设备实现可扩展、低成本、广泛部署的基于人工智能的筛查工具。
提出的方法
- 该模型采用多分支卷积神经网络架构,以并行方式处理不同音频模态——咳嗽声和语音样本。
- 每个分支使用一维卷积层、批归一化和 ReLU 激活函数处理原始音频信号,以提取判别性特征。
- 通过拼接和全连接层将两个分支的表征进行融合,生成最终预测结果。
- 在大规模众包获取的智能手机录音数据集上进行端到端训练,仅进行最少的预处理。
- 应用数据增强技术以提升对录音质量差异和环境噪声的鲁棒性。
- 使用二元交叉熵损失和带有学习率调度的 Adam 优化算法进行模型优化。
实验结果
研究问题
- RQ1在音频质量较差的情况下,是否能够通过在原始、未经处理的智能手机音频上训练的深度学习模型实现高精度的 COVID-19 检测?
- RQ2与单流模型相比,分别处理咳嗽声和语音样本的多分支架构是否能提升检测性能?
- RQ3与在精心筛选的临床数据集上训练的最先进模型相比,该模型在众包获取的嘈杂数据上的表现如何?
- RQ4该模型在不同录音条件和用户人口统计特征下的泛化能力如何?
- RQ5该模型是否能在不依赖人工音频清洗或预处理的情况下,在 COUGHVID 基准上实现高 AUC?
主要发现
- Virufy 模型在 COUGHVID 数据集上对标记为 COVID-19 阳性的音频样本实现了 0.99 的 AUC,表明其具有强大的判别性能。
- 该模型在 COUGHVID 基准上优于现有的最先进方法,确立了新的最先进水平。
- 多分支架构有效捕捉了咳嗽声和语音样本中的互补特征,从而提升了整体检测准确率。
- 由于在未经处理的众包数据上进行训练,该模型在嘈杂的真实音频条件下表现出鲁棒性。
- 在原始、未经清理的音频上的表现表明,该模型在低资源和社区级筛查场景中具有强大的泛化能力。
- 结果验证了利用消费级智能手机通过基于音频的人工智能技术实现可扩展、低成本、自动化的 COVID-19 检测的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。