Skip to main content
QUICK REVIEW

[论文解读] Audio-based AI classifiers show no evidence of improved COVID-19 screening over simple symptoms checkers

Harry Coppock, Nicholson, George|arXiv (Cornell University)|Dec 15, 2022
COVID-19 diagnosis using AI被引用 5
一句话总结

本研究利用大规模、经PCR验证的67,842名个体数据集,评估基于音频的AI分类器在新冠筛查中的表现。尽管初始AUC值较高(0.846),但在调整自报症状等混杂因素后,性能下降至0.619,表明基于音频的分类器在实际应用中并不优于仅依赖症状筛查的方法。

ABSTRACT

Recent work has reported that AI classifiers trained on audio recordings can accurately predict severe acute respiratory syndrome coronavirus 2 (SARSCoV2) infection status. Here, we undertake a large scale study of audio-based deep learning classifiers, as part of the UK governments pandemic response. We collect and analyse a dataset of audio recordings from 67,842 individuals with linked metadata, including reverse transcription polymerase chain reaction (PCR) test outcomes, of whom 23,514 tested positive for SARS CoV 2. Subjects were recruited via the UK governments National Health Service Test-and-Trace programme and the REal-time Assessment of Community Transmission (REACT) randomised surveillance survey. In an unadjusted analysis of our dataset AI classifiers predict SARS-CoV-2 infection status with high accuracy (Receiver Operating Characteristic Area Under the Curve (ROCAUC) 0.846 [0.838, 0.854]) consistent with the findings of previous studies. However, after matching on measured confounders, such as age, gender, and self reported symptoms, our classifiers performance is much weaker (ROC-AUC 0.619 [0.594, 0.644]). Upon quantifying the utility of audio based classifiers in practical settings, we find them to be outperformed by simple predictive scores based on user reported symptoms.

研究动机与目标

  • 评估基于音频的AI分类器是否在简单自报症状检查之外,能提升新冠筛查的准确性。
  • 研究混杂变量(尤其是自报症状)对基于音频的AI模型预测性能的影响。
  • 评估基于音频的分类器在模拟人群筛查场景中的实际应用价值。
  • 为减轻招募偏差并改进AI辅助诊断研究中的研究设计,提供最佳实践指南。
  • 发布一个大规模、公开可用、经PCR验证的数据集,以支持可复现性及未来在呼吸道音频分析领域的研究。

提出的方法

  • 收集了67,842份带有关联PCR检测结果的呼吸音频记录,其中包括23,514例SARS-CoV-2阳性病例。
  • 在数据集上训练多个基于音频的AI分类器,并使用ROC-AUC评估性能,重点关注其在真实世界环境中的泛化能力。
  • 应用倾向得分匹配法,对测量到的混杂因素(如自报症状)进行平衡,模拟更公平的与仅基于症状筛查的比较。
  • 开展匹配后的分析,以隔离在考虑症状和其他混杂因素后,音频特征的剩余预测能力。
  • 在不同临床决策阈值下,使用预期效用指标评估分类器的实用性,比较音频模型、症状模型及联合模型的表现。
  • 在外部数据集中复现研究结果,以验证结果的稳健性和泛化能力。

实验结果

研究问题

  • RQ1在正确调整混杂因素后,基于音频的AI是否能提升新冠筛查的准确性,超越自报症状?
  • RQ2自报症状及其他混杂因素在多大程度上解释了基于音频的AI分类器的预测性能?
  • RQ3当在现实、匹配后的人群条件下评估时,基于音频的分类器性能如何变化,相较于有偏差的招募条件?
  • RQ4在模拟的一般人群筛查场景中,基于音频的分类器与基于症状的筛查相比,其实际效用如何?
  • RQ5未来基于AI的诊断研究如何在研究设计和评估中更好地考虑确认偏差和混杂因素?

主要发现

  • 在未调整分析中,基于音频的AI分类器取得了0.846的高ROC-AUC(95%置信区间:0.838–0.854),与先前研究一致。
  • 在对自报症状等测量混杂因素进行匹配后,ROC-AUC显著下降至0.619(95%置信区间:0.594–0.644),表明音频特征本身剩余的预测能力极低。
  • 在所有模拟的实际应用场景中,基于音频的分类器表现均不如基于症状的筛查,且将音频与症状结合并未带来额外益处。
  • 研究发现,招募偏差——由基于症状的招募驱动——是先前研究中性能被高估的主要原因,因为有症状者被优先纳入。
  • 调整后剩余的预测能力归因于未测量的混杂因素,如数据集中未捕捉到的人口统计学或行为因素。
  • 作者已公开发布数据集和代码库,以支持可复现性,并推动在高维、过参数化AI模型中偏差缓解的未来研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。