Skip to main content
QUICK REVIEW

[论文解读] ESPnet-se: end-to-end speech enhancement and separation toolkit designed for asr integration

Chenda Li, Jing Shi|arXiv (Cornell University)|Nov 7, 2020
Speech and Audio Processing参考文献 60被引用 75
一句话总结

ESPnet-SE 是一个端到端语音增强与分离工具包,专为与自动语音识别(ASR)无缝集成而设计,支持语音增强系统与ASR模型的联合训练与评估。它支持单通道与多通道、自由场与混响、单说话人与多说话人场景,并实现了最先进性能,包括在 WSJ0-2mix 上通过联合优化分离与ASR实现 16.1% 的词错误率(WER)。

ABSTRACT

We present ESPnet-SE, which is designed for the quick development of speech enhancement and speech separation systems in a single framework, along with the optional downstream speech recognition module. ESPnet-SE is a new project which integrates rich automatic speech recognition related models, resources and systems to support and validate the proposed front-end implementation (i.e. speech enhancement and separation).It is capable of processing both single-channel and multi-channel data, with various functionalities including dereverberation, denoising and source separation. We provide all-in-one recipes including data pre-processing, feature extraction, training and evaluation pipelines for a wide range of benchmark datasets. This paper describes the design of the toolkit, several important functionalities, especially the speech recognition integration, which differentiates ESPnet-SE from other open source toolkits, and experimental results with major benchmark datasets.

研究动机与目标

  • 开发一个统一的开源工具包,将端到端语音增强与分离(E2E-SE)与自动语音识别(ASR)集成,实现联合优化。
  • 通过利用转录数据,在无干净参考语音信号的情况下,实现E2E-SE模型与ASR损失的无缝训练与评估。
  • 在一个统一框架内支持单/多通道、自由场/混响、单/多说话人等多种输入条件。
  • 提供开箱即用、端到端的配方,涵盖数据准备、特征提取、训练与基准数据集上的评估。
  • 通过直接集成ESPnet丰富的ASR模型以实现联合优化与性能评估,与现有工具包形成差异化。

提出的方法

  • 将最先进的E2E-SE模型(TasNet、DPRNN、T-F masking、神经波束形成器)集成到基于PyTorch的统一框架中。
  • 支持原始波形输入,并对频域模型应用可微分STFT,实现通过反向传播进行端到端训练。
  • 提供统一的、分阶段的配方,涵盖多个基准数据集的数据预处理、特征提取、模型训练与评估。
  • 支持可选地与ESPnet的ASR模型(如Transformer、CTC、基于注意力的编码器-解码器)集成,以ASR损失进行联合训练。
  • 支持同时使用E2E-SE损失与ASR损失进行联合优化,允许在仅有弱监督数据(如CHiME-4)而无干净参考的情况下直接训练。
  • 使用预训练的ASR模型(如在WSJ上训练的)评估增强/分离后的语音,通过WER/CER实现E2E-SE性能的零样本评估。

实验结果

研究问题

  • RQ1能否在统一框架中有效集成端到端语音增强与分离模型与自动语音识别(ASR),以提升鲁棒性?
  • RQ2E2E-SE与ASR模块的联合优化如何影响在噪声或混响语音上的识别性能?
  • RQ3在使用ASR指标评估时,E2E-SE模型在WSJ0-2mix和空间化WSJ0-2mix等基准数据集上的表现如何?
  • RQ4在仅依赖转录文本而无干净参考语音信号的情况下,E2E-SE系统能否实现具有竞争力的性能?
  • RQ5与独立的E2E-SE或独立的ASR相比,将ASR集成到E2E-SE流程中,在鲁棒性与泛化能力方面表现如何?

主要发现

  • 将Conv-TasNet与ASR模型集成后,在WSJ0-2mix测试集上实现16.7%的WER,证明了其强大的端到端性能。
  • 基于DPRNN的E2E-SE模型在与ASR联合优化后,在WSJ0-2mix上实现16.1%的WER,某些情况下优于独立ASR在WSJ上的表现。
  • 在空间化WSJ0-2mix数据集上,神经波束形成器模型在自由场条件下相比先前工作实现超过7 dB的SDR提升。
  • 在混响条件下,神经波束形成器性能与先前工作相当,当与WPE去混响模块结合时进一步提升。
  • E2E-SE与ASR的联合训练即使仅在WSJ0-2mix数据集上训练,也能提升ASR性能(例如,使用Conv-TasNet + Transformer实现15.8% WER)。
  • 频谱图可视化证实,DPRNN模型能有效从具有挑战性的同性别混合信号中分离出源信号,两个测试样本的SDR分别达到18.54 dB和12.88 dB。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。