[论文解读] End-2-End COVID-19 Detection from Breath & Cough Audio
本文提出 CIdeR,一种端到端深度学习模型,通过联合分析呼吸和咳嗽音频以检测新冠肺炎,其在众包数据集上的 AUC-ROC 达到 0.846。该方法采用自定义的 ResNet 架构,结合频谱图并利用音频片段的多数投票机制,实现可扩展的、低成本的群体水平筛查。
Our main contributions are as follows: (I) We demonstrate the first attempt to diagnose COVID-19 using end-to-end deep learning from a crowd-sourced dataset of audio samples, achieving ROC-AUC of 0.846; (II) Our model, the COVID-19 Identification ResNet, (CIdeR), has potential for rapid scalability, minimal cost and improving performance as more data becomes available. This could enable regular COVID-19 testing at apopulation scale; (III) We introduce a novel modelling strategy using a custom deep neural network to diagnose COVID-19 from a joint breath and cough representation; (IV) We release our four stratified folds for cross parameter optimisation and validation on a standard public corpus and details on the models for reproducibility and future reference.
研究动机与目标
- 开发一种可扩展、低成本的数字健康解决方案,用于快速、广泛的新肺炎筛查。
- 探究联合建模呼吸和咳嗽音频信号是否能提升诊断性能,相较于单独分析。
- 证明在小规模众包音频数据集上,端到端深度学习在新冠肺炎检测中的可行性。
- 通过发布分层交叉验证折和模型细节,实现可复现性。
提出的方法
- 该模型通过 librosa 计算对原始音频波形的对数频谱图,参数为:FFT 大小 512–2048,采样率 24–48 kHz。
- 将呼吸和咳嗽的频谱图在深度方向拼接,形成形状为 {F, W, 2} 的 3D 张量,以实现联合表示。
- 采用基于 ResNet 的自定义架构,通过残差块和跳跃连接,直接从频谱图输入学习分层特征。
- 网络通过最终的全连接层输出单个 Sigmoid 概率分数,使用加权二元交叉熵损失进行训练,以处理类别不平衡问题。
- 从较长录音中均匀采样音频片段,推理阶段通过跨片段的多数投票机制提升鲁棒性。
- 采用三折交叉优化策略并保留固定测试集,确保参数调优过程中不发生测试数据泄露。
实验结果
研究问题
- RQ1端到端深度学习能否有效从呼吸和咳嗽音频信号的组合中检测新冠肺炎?
- RQ2联合建模呼吸和咳嗽是否优于单独建模每种信号?
- RQ3在当前小规模数据集下,模型性能如何随数据量增加而变化?
- RQ4仅使用音频生物标志物,深度学习模型能否泛化到无症状病例?
主要发现
- CIdeR 在区分所有新冠肺炎阳性与阴性参与者的主任务中,AUC-ROC 达到 0.846,显著优于基线模型(p < 0.01)。
- 在主任务中,模型的未加权平均召回率(UAR)为 0.765,表明在正样本和负样本类别中均表现良好。
- 在区分有咳嗽的新冠肺炎患者与有哮喘和咳嗽的患者这一子任务中,CIdeR 的 AUC-ROC 达到 0.909,显示出在具有挑战性的子群体中具有高特异性。
- 在任务 2(区分健康咳嗽者与新冠肺炎阳性咳嗽者)中,模型表现不如基线,可能由于样本量小以及音频模式重叠。
- 通过两样本 t 检验(α = 0.01)确认任务 1、3 和 4 的统计显著性,验证了结果的稳健性。
- 作者发布了全部四个分层交叉验证折和模型代码,以确保完全可复现性及未来基准测试。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。