[论文解读] The Second DiCOVA Challenge: Dataset and performance analysis for COVID-19 diagnosis using acoustics
本文介绍了第二届DiCOVA挑战赛,这是一个基于声学信号(咳嗽、呼吸、语音)进行COVID-19诊断的大规模开放基准。该研究提出一个经过筛选的1,436名个体的数据集,建立了一个基于梅尔频谱图和双向LSTM网络的基线模型,并报告了最先进的性能:融合模型达到88.4%的AUC,证明了基于声学的即时检测诊断的可行性。
The Second Diagnosis of COVID-19 using Acoustics (DiCOVA) Challenge aimed at accelerating the research in acoustics based detection of COVID-19, a topic at the intersection of acoustics, signal processing, machine learning, and healthcare. This paper presents the details of the challenge, which was an open call for researchers to analyze a dataset of audio recordings consisting of breathing, cough and speech signals. This data was collected from individuals with and without COVID-19 infection, and the task in the challenge was a two-class classification. The development set audio recordings were collected from 965 (172 COVID-19 positive) individuals, while the evaluation set contained data from 471 individuals (71 COVID-19 positive). The challenge featured four tracks, one associated with each sound category of cough, speech and breathing, and a fourth fusion track. A baseline system was also released to benchmark the participants. In this paper, we present an overview of the challenge, the rationale for the data collection and the baseline system. Further, a performance analysis for the systems submitted by the $16$ participating teams in the leaderboard is also presented.
研究动机与目标
- 通过信号处理和机器学习技术,加速基于声学的COVID-19检测研究。
- 通过开发低成本、可扩展的即时检测诊断替代方案,解决传统RT-PCR和抗原检测的局限性。
- 通过在多个声音类别(咳嗽、呼吸、语音)上建立经过筛选的数据集和共享的评估协议,确立标准化基准。
- 通过带有盲测数据集的排行榜式挑战,评估并比较不同机器学习模型的性能。
- 通过发布数据、基线系统和公开排行榜,促进可复现性和协作。
提出的方法
- 从开发集中的965名个体(172名COVID-19阳性)和评估集中的471名个体(71名阳性)收集音频数据,包括咳嗽、呼吸和语音样本。
- 使用192×T特征矩阵(T=51)进行梅尔频谱图提取,并应用10帧步长进行分块处理。
- 使用二元交叉熵损失、Adam优化器(初始初始值为0.0001)、L2正则化(0.0001)和dropout(0.1)训练基于BiLSTM的分类器。
- 通过在小批量采样过程中对少数类(COVID)进行过采样,实现类别平衡,以缓解类别不平衡问题。
- 通过平均各受试者在三种声音类别模型中的概率得分,融合预测结果,以提升整体诊断性能。
- 采用5折交叉验证进行模型训练和推理,最终测试预测结果在各折上取平均以增强鲁棒性。
实验结果
研究问题
- RQ1来自咳嗽、呼吸和语音信号的声学特征能否可靠地检测出COVID-19感染,且具有高敏感性和特异性?
- RQ2不同机器学习架构和特征表示在从音频信号分类COVID-19状态方面的表现如何比较?
- RQ3与单模态模型相比,跨多个声音类别融合预测在多大程度上能提升诊断性能?
- RQ4在共享的开放数据集上,最先进模型的性能与标准化基线系统相比如何?
- RQ5COVID-19在呼吸声中的关键声学特征是什么?这些特征能否在不同人群中一致检测到?
主要发现
- 基线系统在呼吸、咳嗽和语音上的AUC分别为77.3%、75.2%和80.2%,融合模型达到81.67%的AUC。
- 表现最佳的团队在呼吸赛道中达到87.2%的AUC,咳嗽赛道为82.0%,语音赛道为85.2%,融合赛道为88.4%。
- 假设采用前三名团队预测结果的汇总系统,性能进一步提升至88.8%(呼吸)、84.5%(咳嗽)、86.7%(语音)和90.4%(融合)的AUC。
- 在咳嗽赛道中,有10支团队优于基线;而在呼吸、语音和融合赛道中,分别有4支、3支和5支团队超越基线。
- 表现最佳的团队(T-15)使用了基于wav2vec2.0嵌入的BiLSTM和跨类别模型参数平均,实现了各赛道的高性能表现。
- 表现最佳的团队(T-14)使用了随机森林和多层感知机,结合RASTA-PLP特征,在呼吸和咳嗽赛道中表现出色。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。