Skip to main content
QUICK REVIEW

[论文解读] INTERSPEECH 2021 ConferencingSpeech Challenge: Towards Far-field Multi-Channel Speech Enhancement for Video Conferencing

Wei Rao, Yihui Fu|arXiv (Cornell University)|Apr 2, 2021
Speech and Audio Processing参考文献 30被引用 7
一句话总结

本论文介绍了 INTERSPEECH 2021 ConferencingSpeech 挑战赛,这是一项针对真实视频会议环境的远场多通道语音增强计划。该挑战赛设置了两个任务——使用单个麦克风阵列进行实时增强,以及使用多个分布式麦克风阵列进行非实时增强,基于新录制的12间真实会议室的语音数据集。基线系统采用基于复数比值掩蔽(CRM)的深度学习模型,利用通道间相位差和三层LSTM,实现了0.0425的实时因子,并通过主观MOS评估验证了其在语音质量提升方面的有效性。

ABSTRACT

The ConferencingSpeech 2021 challenge is proposed to stimulate research on far-field multi-channel speech enhancement for video conferencing. The challenge consists of two separate tasks: 1) Task 1 is multi-channel speech enhancement with single microphone array and focusing on practical application with real-time requirement and 2) Task 2 is multi-channel speech enhancement with multiple distributed microphone arrays, which is a non-real-time track and does not have any constraints so that participants could explore any algorithms to obtain high speech quality. Targeting the real video conferencing room application, the challenge database was recorded from real speakers and all recording facilities were located by following the real setup of conferencing room. In this challenge, we open-sourced the list of open source clean speech and noise datasets, simulation scripts, and a baseline system for participants to develop their own system. The final ranking of the challenge will be decided by the subjective evaluation which is performed using Absolute Category Ratings (ACR) to estimate Mean Opinion Score (MOS), speech MOS (S-MOS), and noise MOS (N-MOS). This paper describes the challenge, tasks, datasets, and subjective evaluation. The baseline system which is a complex ratio mask based neural network and its experimental results are also presented.

研究动机与目标

  • 激发在复杂声学条件下真实视频会议环境中远场多通道语音增强的研究。
  • 应对真实会议室中混响、背景噪声以及说话人与麦克风距离变化带来的挑战。
  • 推动低延迟、无未来帧依赖的实时语音增强系统,以实现实际部署。
  • 支持通过先进算法方法,非实时探索多个分布式麦克风阵列以实现更优的语音质量。
  • 通过主观评价的绝对类别评分(ACR)建立基准,用于测量平均意见得分(MOS)、语音MOS(S-MOS)和噪声MOS(N-MOS)。

提出的方法

  • 该挑战赛使用在12间不同大小、材质和噪声类型的会议室中录制的真实世界数据集,包含具有三种几何拓扑结构的多个麦克风阵列。
  • 对于任务1,强制实现实时处理,最大帧长为40ms,且在Intel Core i5处理器上实时因子≤1.0。
  • 对于任务2,非实时处理允许对算法进行完整探索,使用多个分布式麦克风阵列。
  • 基线系统采用基于复数比值掩蔽(CRM)的神经网络,输入包括第一只麦克风的幅度和相位,以及来自四对麦克风的通道间相位差(IPD)。
  • 输入特征沿频率轴拼接为6F×T张量,经由三层实值LSTM处理后,通过全连接层预测CRM的实部和虚部。
  • 通过逆STFT重构增强语音:Y_r = M_r * X_0r - M_i * X_0i 和 Y_i = M_r * X_0i + M_i * X_0r。

实验结果

研究问题

  • RQ1在真实视频会议条件下,基于复数比值掩蔽的深度学习系统在远场多通道语音增强中的有效性如何?
  • RQ2能否在使用单个麦克风阵列的同时,实现低延迟实时处理并保持高感知语音质量?
  • RQ3与单个阵列相比,多个分布式麦克风阵列在多大程度上提升了语音增强性能?
  • RQ4通道间相位差(IPD)的使用如何增强混响环境中多通道语音增强的鲁棒性?
  • RQ5在不同信噪比(0–30 dB)的仿真数据上进行训练,对模型在真实测试条件下的泛化能力有何影响?

主要发现

  • 基线系统在Intel Xeon处理器上实现了0.0425的实时因子,展现出优异的实时性能,适用于实际部署。
  • 在开发仿真集中的实验表明,该系统能有效提升噪声语音的质量,语音质量指标得到显著改善。
  • 对于多个麦克风阵列,通过信噪比(SNR)选择三个单阵列模型(圆形、线性均匀、线性非均匀)的输出,性能略优于仅使用单一模型。
  • 从四个精心选择的麦克风对中提取的通道间相位差(IPD)提升了模型对空间线索的估计能力,从而实现更优的增强效果。
  • 该挑战赛共收到17支团队的21份提交,其中5支团队同时参与了两个任务,表明该领域具有强烈的科研兴趣和积极的参与度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。