Skip to main content
QUICK REVIEW

[论文解读] Audio, Speech, Language, & Signal Processing for COVID-19: A Comprehensive Overview.

Gauri Deshpande, Björn W. Schuller|arXiv (Cornell University)|Nov 29, 2020
Music and Audio Processing参考文献 84被引用 18
一句话总结

本文全面综述了用于新冠肺炎筛查、诊断、监测和意识提升的音频、语音及信号处理技术。该研究整合了关于通过咳嗽声、呼吸模式和语音检测新冠肺炎标志物的研究,利用人工智能实现非侵入性、可扩展的数字健康工具,并在症状检测和情绪状态评估方面展现出显著的准确性。

ABSTRACT

The Coronavirus (COVID-19) pandemic has been the research focus world-wide in the year 2020. Several efforts, from collection of COVID-19 patients' data to screening them for the virus's detection are taken with rigour. A major portion of COVID-19 symptoms are related to the functioning of the respiratory system, which in-turn critically influences the human speech production system. This drives the research focus towards identifying the markers of COVID-19 in speech and other human generated audio signals. In this paper, we give an overview of the speech and other audio signal, language and general signal processing-based work done using Artificial Intelligence techniques to screen, diagnose, monitor, and spread the awareness aboutCOVID-19. We also briefly describe the research related to detect accord-ing COVID-19 symptoms carried out so far. We aspire that this collective information will be useful in developing automated systems, which can help in the context of COVID-19 using non-obtrusive and easy to use modalities such as audio, speech, and language.

研究动机与目标

  • 整合并分析现有利用音频和语音信号检测与监测新冠肺炎症状的研究。
  • 识别适用于疫情期间非侵入性远程健康监测的关键人工智能信号处理技术。
  • 评估语音和音频分析在检测新冠肺炎呼吸和心理标志物方面的潜力。
  • 指出当前研究中的空白,并指导可靠、可扩展的数字健康工具的未来发展。
  • 支持开发自动化、低成本且易于获取的系统,以在疫情期间实现早期检测和心理健康支持。

提出的方法

  • 对音频、语音及信号处理在新冠肺炎应用方面的同行评审文献和技术报告进行系统性综述。
  • 根据应用领域对研究进行分类:筛查/诊断、监测、意识提升以及行为与心理健康追踪。
  • 分析所使用的机器学习与深度学习模型,包括卷积神经网络(CNNs)、循环神经网络(RNNs)、注意力机制,以及梅尔频率倒谱系数(MFCCs)和词袋(BoAW)等特征提取技术。
  • 利用标准指标(如准确率、F1值、斯皮尔曼等级相关系数、均方根误差(RMSE)和平均绝对误差(MAE))在多样化数据集上评估模型性能。
  • 纳入基准数据集,如DAIC-WOZ、COVIG-19等离子体联盟数据集以及Interspeech 2019嗜睡挑战赛数据。
  • 整合语音、咳嗽声、呼吸信号及情感信号分析的发现,以识别呼吸与心理健康的跨模态生物标志物。

实验结果

研究问题

  • RQ1哪些音频和语音信号特征可可靠指示新冠肺炎或其症状的存在?
  • RQ2基于人工智能的模型在从语音和音频信号中检测咳嗽、呼吸频率和阻塞性睡眠呼吸暂停(OSA)等呼吸异常方面效果如何?
  • RQ3语音和音频处理在疫情期间压力与孤独感背景下的心理健康监测中能发挥多大作用?
  • RQ4在使用音频模态进行远程新冠肺炎筛查时,实际部署系统面临的主要挑战是什么?
  • RQ5如何利用语音与语言处理技术提升疫情期间公众意识与行为健康?

主要发现

  • 使用深度学习模型分析咳嗽声,在区分新冠肺炎咳嗽与健康及非新冠肺炎咳嗽方面准确率最高达98.5%。
  • 基于语音的呼吸症状检测(如呼吸困难和声音疲劳)在控制实验中表现出高敏感度与特异度。
  • 采用注意力机制与自编码器融合的模型在基于语音信号预测嗜睡程度时,斯皮尔曼等级相关系数达到0.367。
  • 分层注意力迁移网络在DAIC-WOZ数据集上对PHQ-8抑郁量表的预测中,均方根误差(RMSE)为5.66,平均绝对误差(MAE)为4.28。
  • 使用紧凑型神经网络将模型大小减少95%而未影响识别性能,使模型可在边缘设备上部署。
  • 与音频分析集成的聊天机器人在减轻心理困扰和改善健康行为方面展现出潜力,但设计质量对结果影响显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。