Skip to main content
QUICK REVIEW

[论文解读] Speech enhancement aided end-to-end multi-task learning for voice activity detection

Xu Tan, Xiao-Lei Zhang|arXiv (Cornell University)|Oct 23, 2020
Speech and Audio Processing参考文献 26被引用 4
一句话总结

该论文提出了一种端到端的多任务学习框架,通过一种新颖的损失函数——VAD掩码的尺度不变信噪比(mSI-SDR),联合优化语音增强(SE)与语音活动检测(VAD)。通过在训练过程中利用VAD预测结果对SE输出进行掩码,该方法实现了目标层面的联合优化,在低信噪比及嘈杂环境中(尤其是babble和人为干扰场景)显著提升了VAD的鲁棒性,同时保持了实时处理能力,并优于单任务及先前的多任务基线模型。

ABSTRACT

Robust voice activity detection (VAD) is a challenging task in low signal-to-noise (SNR) environments. Recent studies show that speech enhancement is helpful to VAD, but the performance improvement is limited. To address this issue, here we propose a speech enhancement aided end-to-end multi-task model for VAD. The model has two decoders, one for speech enhancement and the other for VAD. The two decoders share the same encoder and speech separation network. Unlike the direct thought that takes two separated objectives for VAD and speech enhancement respectively, here we propose a new joint optimization objective -- VAD-masked scale-invariant source-to-distortion ratio (mSI-SDR). mSI-SDR uses VAD information to mask the output of the speech enhancement decoder in the training process. It makes the VAD and speech enhancement tasks jointly optimized not only at the shared encoder and separation network, but also at the objective level. It also satisfies real-time working requirement theoretically. Experimental results show that the multi-task method significantly outperforms its single-task VAD counterpart. Moreover, mSI-SDR outperforms SI-SDR in the same multi-task setting.

研究动机与目标

  • 提升在低信噪比(SNR)和嘈杂环境中语音活动检测(VAD)的鲁棒性,这些场景下单任务VAD模型表现不佳。
  • 通过实现语音增强与VAD之间更深层次的联合优化,解决先前SE增强VAD方法性能增益有限的问题。
  • 设计一种新颖的联合优化目标,将VAD监督信息整合到语音增强损失函数中,增强两者的相互学习能力。
  • 通过保留Conv-TasNet的低延迟结构,确保模型支持实时推理。
  • 验证所提出的多任务框架结合mSI-SDR在VAD和SE指标上均优于仅VAD或仅SE的基线模型。

提出的方法

  • 模型在语音增强和VAD任务中共享编码器和时间卷积网络(TCN),每个任务分别使用独立的解码器。
  • 所提出的mSI-SDR损失函数在训练过程中利用真实标签和预测的VAD标签对语音增强输出进行掩码,使优化聚焦于语音活动段。
  • mSI-SDR定义为仅在VAD标签为活动状态(1)的帧上计算的尺度不变信噪比,使SE损失更贴近VAD性能。
  • 该架构基于Conv-TasNet,通过因果空洞卷积和累积层归一化,确保低延迟推理与实时运行。
  • 模型采用端到端训练,多任务目标结合了mSI-SDR用于SE和二元交叉熵损失用于VAD。
  • 该框架不仅在共享编码器和分离网络层面实现联合优化,还在损失函数层面实现联合优化,增强了任务对齐。

实验结果

研究问题

  • RQ1语音增强与语音活动检测的联合训练是否能提升低信噪比环境下的VAD鲁棒性?
  • RQ2将VAD监督信息集成到语音增强损失函数中,是否能优于独立训练或级联训练?
  • RQ3在多任务设置中,所提出的mSI-SDR损失函数是否能超越标准SI-SDR?
  • RQ4该多任务模型在提升性能的同时是否仍保持实时推理能力?
  • RQ5在多样化嘈杂环境中,所提方法与单任务VAD和SE基线模型相比表现如何?

主要发现

  • 在-5 dB SNR的babble噪声环境下,所提出的Multi-mSS模型相较于仅VAD模型,AUC相对提升73.77%,EER相对降低59.83%。
  • 在最具挑战性的环境(-5 dB SNR的babble噪声)下,Multi-mSS相较于Multi-SS基线模型,AUC相对提升30.43%,EER相对降低16.87%。
  • Multi-mSS的因果版本保持了强劲性能,与非因果版本相比性能下降极小,证实了其具备实时可行性。
  • Multi-mSS的语音增强指标(PESQ、STOI、SI-SDR)与仅SE模型相当,表明SE性能未出现显著退化。
  • mSI-SDR损失在相同多任务设置下优于SI-SDR,证明了VAD引导掩码在SE优化中的有效性。
  • 该模型在语音谱特性与噪声相似的环境(如babble、café、行人噪声)中表现出最大的性能增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。