[论文解读] AV Speech Enhancement Challenge using a Real Noisy Corpus
本文介绍了 ASPIRE 语料库,这是首个在咖啡馆和餐厅等嘈杂环境中真实录制的音视频语音增强数据集。通过使用融合音频与视觉线索的深度神经网络(CochleaNet),研究结果表明,在真实嘈杂环境下,音视频语音增强方法显著优于仅使用音频的方法,其中 AV CochleaNet 在 MUSHRA 测试中取得了最高的主观质量评分。
This paper presents, a first of its kind, audio-visual (AV) speech enhacement challenge in real-noisy settings. A detailed description of the AV challenge, a novel real noisy AV corpus (ASPIRE), benchmark speech enhancement task, and baseline performance results are outlined. The latter are based on training a deep neural architecture on a synthetic mixture of Grid corpus and ChiME3 noises (consisting of bus, pedestrian, cafe, and street noises) and testing on the ASPIRE corpus. Subjective evaluations of five different speech enhancement algorithms (including SEAGN, spectrum subtraction (SS) , log-minimum mean-square error (LMMSE), audio-only CochleaNet, and AV CochleaNet) are presented as baseline results. The aim of the multi-modal challenge is to provide a timely opportunity for comprehensive evaluation of novel AV speech enhancement algorithms, using our new benchmark, real-noisy AV corpus and specified performance metrics. This will promote AV speech processing research globally, stimulate new ground-breaking multi-modal approaches, and attract interest from companies, academics and researchers working in AV speech technologies and applications. We encourage participants (through a challenge website sign-up) from both the speech and hearing research communities, to benefit from their complementary approaches to AV speech in noise processing.
研究动机与目标
- 为解决评估多模态语音增强系统时缺乏真实世界、自然录制的音视频语音语料库的问题。
- 提供一个具有真实噪声、说话人移动和视觉遮挡的基准语料库,以反映真实生活中的 Lombard 效应条件。
- 通过主观听音测试,评估音视频语音增强算法在真实嘈杂语料库上的性能表现。
- 通过提供标准化评估指标的公开挑战,促进多模态语音处理领域的创新。
- 通过共享基准,促进语音处理与听力研究社区之间的合作。
提出的方法
- ASPIRE 语料库在真实嘈杂环境(如咖啡馆、餐厅)以及声学隔离的隔间中采集,使用双耳麦克风和 iPad 以 30 fps 的帧率进行视频录制。
- 每位说话人在每种条件下(真实嘈杂环境与隔离环境)生成 1000 个语音样本,总计 10,000 个语音样本,涵盖多种英语口音。
- 通过拍手方式校正音视频漂移,并使用 Gentle 工具进行强制对齐以分割语音样本。
- 对视频进行后处理,利用分割掩码对非说话人区域进行像素化处理,以保护隐私。
- 在合成混合数据上训练了一个深度神经网络 CochleaNet,该数据混合了 Grid 语料库与 ChiME3 噪声(公交车、咖啡馆、街道、行人)在信噪比(SNR)从 -12 到 9 dB、每 3 dB 一个步长的范围内。
- AV CochleaNet 模型融合音频与视觉特征,以估计时频单元的谱掩码,且该过程与 SNR 无关。
实验结果
研究问题
- RQ1与仅使用音频的方法相比,音视频语音增强在真实嘈杂语料库上的表现如何?
- RQ2在合成数据上训练的深度学习模型能否有效泛化到真实世界的嘈杂环境?
- RQ3在混响和多源噪声环境中,视觉线索在多大程度上提升了语音质量?
- RQ4当在真实嘈杂 AV 数据上测试时,不同语音增强算法在主观质量上的排名如何?
- RQ5多模态方法是否比传统仅使用音频的方法更能有效应对 Lombard 效应和说话人移动?
主要发现
- AV CochleaNet 在所有评估方法中取得了最高的 MUSHRA 评分,表明其在真实嘈杂数据上的卓越性能。
- 主观听音测试显示,AV CochleaNet 显著优于仅使用音频的 CochleaNet、SEGAN、谱减法(SS)和 LMMSE 方法。
- 该模型在真实嘈杂条件下表现出良好的泛化能力,能有效抑制混响和多源背景噪声。
- 引入视觉信息显著提升了语音质量,尤其在高噪声场景下,当存在说话人移动和遮挡时更为明显。
- ASPIRE 语料库使得 AV 语音增强系统的可靠基准测试成为可能,结果表明多模态方法对于实现真实世界鲁棒性至关重要。
- 挑战框架(包括公开数据和标准化评估)支持了机构间可复现且可比较的研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。