Skip to main content
QUICK REVIEW

[论文解读] A large-scale and PCR-referenced vocal audio dataset for COVID-19

Jobie Budd, Kieran Baker|arXiv (Cornell University)|Dec 15, 2022
Phonocardiography and Auscultation Techniques被引用 4
一句话总结

本文介绍了英国新冠语音音频数据集,这是一个大规模、经PCR确诊的语音记录集合(包括咳嗽声、呼气声和言语),涵盖英格兰70,794名参与者,与SARS-CoV-2检测结果及自我报告症状相关联。该数据集使机器学习模型能够通过音频检测感染状态和呼吸道状况,包含24,155例阳性病例和27.2%的流感检测数据,是迄今为止规模最大的同类数据集。

ABSTRACT

The UK COVID-19 Vocal Audio Dataset is designed for the training and evaluation of machine learning models that classify SARS-CoV-2 infection status or associated respiratory symptoms using vocal audio. The UK Health Security Agency recruited voluntary participants through the national Test and Trace programme and the REACT-1 survey in England from March 2021 to March 2022, during dominant transmission of the Alpha and Delta SARS-CoV-2 variants and some Omicron variant sublineages. Audio recordings of volitional coughs, exhalations, and speech were collected in the 'Speak up to help beat coronavirus' digital survey alongside demographic, self-reported symptom and respiratory condition data, and linked to SARS-CoV-2 test results. The UK COVID-19 Vocal Audio Dataset represents the largest collection of SARS-CoV-2 PCR-referenced audio recordings to date. PCR results were linked to 70,794 of 72,999 participants and 24,155 of 25,776 positive cases. Respiratory symptoms were reported by 45.62% of participants. This dataset has additional potential uses for bioacoustics research, with 11.30% participants reporting asthma, and 27.20% with linked influenza PCR test results.

研究动机与目标

  • 创建一个大规模、具有临床参考价值的语音音频数据集,以支持机器学习模型通过语音样本检测SARS-CoV-2感染。
  • 将语音记录与金标准SARS-CoV-2 PCR检测结果关联,以支持可靠模型的训练与评估。
  • 纳入自我报告症状、呼吸道疾病状况及流感检测结果,以支持更广泛的生物声学与多病种研究。
  • 支持开发基于语音诊断的非侵入性、可扩展的呼吸道感染筛查工具。
  • 提供一个公开可用、伦理来源的数据集,真实反映主要SARS-CoV-2变异株传播期间的人群多样性。

提出的方法

  • 参与者通过英国检测与追踪计划及REACT-1调查于2021年3月至2022年3月期间招募。
  • 语音样本通过数字调查收集,包括自愿咳嗽、呼气和持续言语。
  • 每位参与者的音频均与其SARS-CoV-2 PCR检测结果、自我报告症状及既往呼吸道疾病状况关联。
  • 该数据集包含70,794名经PCR确诊的参与者,其中24,155例为SARS-CoV-2阳性,27.2%的参与者具有同步的流感PCR检测结果。
  • 同时收集了人口统计学、症状及健康史数据,以支持多模态分析。
  • 该数据集经过伦理监督进行整理与发布,确保参与者隐私与数据完整性。

实验结果

研究问题

  • RQ1仅依靠语音音频特征,能否通过机器学习可靠地区分SARS-CoV-2阳性与阴性个体?
  • RQ2语音模式与自我报告的呼吸道症状或哮喘等既往疾病状况的相关性有多大?
  • RQ3纳入流感检测结果在多大程度上提升了该数据集在鉴别诊断研究中的实用性?
  • RQ4该数据集能否支持在社区环境中开发可扩展的非侵入性呼吸道感染筛查工具?
  • RQ5变异株动态(Alpha、Delta、Omicron)对音频中可检测到的语音生物标志物有何影响?

主要发现

  • 该数据集包含70,794名经PCR确诊SARS-CoV-2状态的参与者,是迄今为止规模最大的同类集合。
  • 其中24,155名参与者SARS-CoV-2检测呈阳性,为诊断模型的训练与评估提供了充足数据。
  • 45.62%的参与者报告了呼吸道症状,表明语音特征与症状之间存在显著关联。
  • 11.30%的参与者报告患有哮喘,为慢性呼吸道疾病语音生物标志物研究提供了支持。
  • 27.20%的参与者具有关联的流感PCR检测结果,支持多病原体诊断研究。
  • 该数据集覆盖了Alpha、Delta及早期Omicron变异株流行期,捕捉了主要SARS-CoV-2谱系下的语音变化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。