[论文解读] ICASSP 2021 Acoustic Echo Cancellation Challenge: Datasets and Testing Framework.
本文介绍了 ICASSP 2021 声学回声消除挑战赛,发布了超过 2,500 个真实设备在多样化环境中的录音,用于在单人对话和双人对话场景下训练 AEC 模型。该研究提供了一个基于 ITU-T P.808 的开源在线测试框架,用于主观评估,胜者由所有条件下的平均意见得分(MOS)决定。
The ICASSP 2021 Acoustic Echo Cancellation Challenge is intended to stimulate research in the area of acoustic echo cancellation (AEC), which is an important part of speech enhancement and still a top issue in audio communication and conferencing systems. Many recent AEC studies report reasonable performance on synthetic datasets where the train and test samples come from the same underlying distribution. However, the AEC performance often degrades significantly on real recordings. Also, most of the conventional objective metrics such as echo return loss enhancement (ERLE) and perceptual evaluation of speech quality (PESQ) do not correlate well with subjective speech quality tests in the presence of background noise and reverberation found in realistic environments. In this challenge, we open source two large datasets to train AEC models under both single talk and double talk scenarios. These datasets consist of recordings from more than 2,500 real audio devices and human speakers in real environments, as well as a synthetic dataset. We open source an online subjective test framework based on ITU-T P.808 for researchers to quickly test their results. The winners of this challenge will be selected based on the average P.808 Mean Opinion Score (MOS) achieved across all different single talk and double talk scenarios.
研究动机与目标
- 弥合合成数据集与真实录音在 AEC 性能上的差距,因为模型在真实场景中性能通常显著下降。
- 通过使用更能反映在噪声和混响环境下真实语音质量的主观测试,取代传统的 ERLE 和 PESQ 等客观指标,以提高评估的可靠性。
- 提供来自超过 2,500 个真实音频设备和真实人类说话者的规模化、逼真的训练数据,用于自然环境中的训练。
- 通过公开可用的在线主观测试框架,实现在单人对话和双人对话场景下的标准化基准测试。
- 通过聚焦于主观质量作为主要评估指标,并基于 ITU-T P.808,推动鲁棒 AEC 的研究。
提出的方法
- 发布两个大规模数据集:一个包含在真实环境中录制的超过 2,500 个真实音频设备和人类说话者的实际录音,另一个为训练目的提供的合成数据集。
- 设计一个符合 ITU-T P.808 标准的在线测试框架,用于开展 AEC 性能的主观意见测试。
- 从人类听者处收集多个单人对话和双人对话场景下的平均意见得分(MOS),以评估感知质量。
- 将所有测试条件下的平均 MOS 作为主要指标,用于排名和选择挑战赛胜者。
- 通过公开测试基础设施和数据集,确保可复现性和公平性。
- 将评估重点放在真实世界条件上,包括背景噪声和房间混响,以反映实际部署中的挑战。
实验结果
研究问题
- RQ1在分布相同的情况下,AEC 模型在真实录音上的表现与在合成数据集上的表现相比如何?
- RQ2在噪声和混响环境中,传统客观指标如 ERLE 和 PESQ 与主观语音质量的相关性有多大?
- RQ3大规模真实世界数据集是否能提升 AEC 模型在复杂声学条件下的鲁棒性?
- RQ4基于 ITU-T P.808 的在线主观测试框架在跨多样化场景基准测试 AEC 系统方面有多高效?
- RQ5在通过主观质量得分评估时,双人对话场景对 AEC 性能有何影响?
主要发现
- 该挑战赛数据集包含超过 2,500 个真实音频设备和真实人类说话者在真实环境中的录音,支持逼真的 AEC 训练。
- 基于 ITU-T P.808 的开源在线测试框架使研究人员能够对 AEC 性能进行标准化、可扩展的主观评估。
- 挑战赛胜者根据所有单人对话和双人对话场景下的平均意见得分(MOS)选出。
- 主观 MOS 得分被证明在反映真实世界条件下感知质量方面,比传统指标如 ERLE 和 PESQ 更可靠。
- 同时包含真实和合成数据集,支持在多样化声学条件下的训练与评估。
- 该框架使研究人员能够在包含噪声和混响等复杂声学环境的真实场景下,直接比较 AEC 模型的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。