[论文解读] DiCOVA-Net: Diagnosing COVID-19 using Acoustics based on Deep Residual Network for the DiCOVA Challenge 2021
本文提出DiCOVA-Net,一种基于深度残差网络的模型,通过数据增强、焦点损失、迁移学习和集成学习,利用咳嗽音频诊断COVID-19,以解决类别不平衡问题。该方法在DiCOVA Challenge 2021测试集上达到85.43%的AUC,优于基线模型和当前最先进方法。
In this paper, we propose a deep residual network-based method, namely the DiCOVA-Net, to identify COVID-19 infected patients based on the acoustic recording of their coughs. Since there are far more healthy people than infected patients, this classification problem faces the challenge of imbalanced data. To improve the model's ability to recognize minority class (the infected patients), we introduce data augmentation and cost-sensitive methods into our model. Besides, considering the particularity of this task, we deploy some fine-tuning techniques to adjust the pre-training ResNet50. Furthermore, to improve the model's generalizability, we use ensemble learning to integrate prediction results from multiple base classifiers generated using different random seeds. To evaluate the proposed DiCOVA-Net's performance, we conducted experiments with the DiCOVA challenge dataset. The results show that our method has achieved 85.43\% in AUC, among the top of all competing teams.
研究动机与目标
- 开发一种稳健的、非侵入性的方法,通过咳嗽音频记录诊断COVID-19。
- 解决DiCOVA Challenge 2021数据集中严重的类别不平衡问题,其中感染病例远多于健康个体。
- 通过先进的深度学习技术提升模型泛化能力和少数类检测性能。
- 在基于音频分类的DiCOVA Challenge 2021基准上实现最先进性能。
提出的方法
- 使用librosa将原始咳嗽音频转换为梅尔频谱图,以适配深度学习模型。
- 应用基于高斯噪声的数据增强方法,增加少数类(感染)样本数量,提升模型鲁棒性。
- 采用焦点损失作为目标函数,降低简单负样本的影响,提升对少数类的学习效果。
- 通过迁移学习微调预训练的ResNet50模型,使其适应音频分类任务。
- 通过训练四个使用不同随机种子的模型并集成其预测结果,采用集成学习方法提升泛化能力。
- 在模型选择和验证过程中,使用受试者工作特征曲线下面积(AUC)作为主要评估指标。
实验结果
研究问题
- RQ1尽管存在严重类别不平衡,深度残差网络能否有效从咳嗽音频中分类COVID-19?
- RQ2数据增强和焦点损失在少数类检测中的单独作用与联合效果如何,特别是在类别不平衡的医学音频数据集中?
- RQ3在音频频谱图上微调预训练的ResNet50是否比从零开始训练或使用传统机器学习模型表现更优?
- RQ4在该诊断任务中,采用随机数据采样的集成学习在多大程度上提升了模型的鲁棒性和泛化能力?
- RQ5在基于音频的诊断设置中,何种损失函数与数据增强策略的组合能最大化AUC?
主要发现
- 集成模型在测试集上达到最高的AUC 85.43%,位列DiCOVA Challenge 2021的顶尖方法之中。
- 焦点损失与高斯噪声增强结合(FL_Gua)优于其他组合,测试AUC达到83.59%。
- 使用高斯噪声的数据增强比简单复制更有效,能显著提升模型泛化能力和少数类识别能力。
- 集成方法通过结合使用不同随机种子训练的多个模型,显著优于单个模型,展现出更强的鲁棒性。
- 微调后的ResNet50结合焦点损失与数据增强,优于随机森林、多层感知机和逻辑回归等传统模型。
- 模型在各折上表现稳定,验证AUC为76.29%,表明具备良好的泛化能力且过拟合程度较低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。