[论文解读] An End-to-end Architecture of Online Multi-channel Speech Separation
本文提出了一种端到端在线多通道语音分离系统 E2E-UFE,该系统将语音解混、通过注意力模块进行波束选择以及语音提取整合到一个可联合训练的架构中。通过使用注意力机制使波束选择模块可微分,从而实现梯度在该模块中的反向传播,E2E-UFE 在离线评估中达到与原始模块化 UFE 系统相当的性能,并在分块在线评估中实现 12.47% 的相对 WER 降低,表明其在实时场景中具备更强的鲁棒性。
Multi-speaker speech recognition has been one of the keychallenges in conversation transcription as it breaks the singleactive speaker assumption employed by most state-of-the-artspeech recognition systems. Speech separation is consideredas a remedy to this problem. Previously, we introduced a sys-tem, calledunmixing,fixed-beamformerandextraction(UFE),that was shown to be effective in addressing the speech over-lap problem in conversation transcription. With UFE, an inputmixed signal is processed by fixed beamformers, followed by aneural network post filtering. Although promising results wereobtained, the system contains multiple individually developedmodules, leading potentially sub-optimum performance. In thiswork, we introduce an end-to-end modeling version of UFE. Toenable gradient propagation all the way, an attentional selectionmodule is proposed, where an attentional weight is learnt foreach beamformer and spatial feature sampled over space. Ex-perimental results show that the proposed system achieves com-parable performance in an offline evaluation with the originalseparate processing-based pipeline, while producing remark-able improvements in an online evaluation.
研究动机与目标
- 为解决模块化、独立优化的语音分离系统(如 UFE)因间接训练目标而导致的次优性能问题。
- 通过一种新颖的注意力选择机制,使波束选择模块可微分,从而实现多通道语音分离的端到端训练。
- 提升在在线、实时语音分离场景下的鲁棒性和性能,特别是在分块处理约束条件下。
- 在保持低延迟以实现对话转录实际部署的前提下,实现语音解混与提取网络的联合优化。
提出的方法
- 提出一种端到端架构 E2E-UFE,用可学习的注意力选择模块替代 UFE 中独立的声源定位(SSL)模块,以实现波束选择过程中的梯度反向传播。
- 采用可微分的注意力机制,基于在频率和时间上采样的空间特征,为固定波束成形器计算空间注意力权重。
- 在语音解混网络中使用排列不变训练(PIT)与缩放不变信噪比(Si-SNR)作为损失函数,以提升分离质量。
- 采用联合训练策略,先对解混和提取网络进行预训练,再通过降低初始的初始学习率进行端到端微调。
- 使用短时傅里叶变换(STFT)特征,包括对数幅度谱和麦克风间相位差(cosIPDs)作为神经网络的输入特征。
- 在分块在线处理中采用双缓冲机制,配备 2 秒或 4 秒的回溯上下文,以模拟实时约束条件。
实验结果
研究问题
- RQ1能否设计一种可端到端训练的在线多通道语音分离架构,使梯度能够通过波束选择过程?
- RQ2通过端到端训练联合优化解混与提取网络,与模块化、独立训练的系统相比,性能提升如何?
- RQ3在实时语音分离中,离线与在线评估之间的性能差距是多少?E2E-UFE 是否能缩小这一差距?
- RQ4与原始 UFE 相比,端到端训练是否使系统在推理过程中对错误波束选择更具鲁棒性?
主要发现
- 在模拟和半真实数据集上,E2E-UFE 在离线评估中达到与原始 UFE 系统相当的词错误率(WER)性能。
- 在半真实数据集上,E2E-UFE 在 OV35 和 OV75 上分别实现相对于 UFE 的 4.8% 和 4.3% 相对 WER 降低,WER 分别达到 33.89% 和 35.92%。
- 在分块在线评估中,E2E-UFE 在模拟数据集上实现 29.71% 的相对 WER 降低,在半真实数据集上实现 12.47% 的平均相对 WER 降低,均优于原始 UFE 系统。
- 原始 UFE 系统在在线设置中性能显著下降,模拟数据上的 WER 从 16.44% 上升至 24.10%,半真实数据上的 WER 从 35.60% 上升至 44.05%,表明其对延迟约束的鲁棒性较差。
- E2E-UFE 的鲁棒性归因于联合优化策略,使模型在训练中暴露于错误的波束选择,而原始 UFE 仅在训练中看到正确的波束。
- 两个系统均未使用稀疏化技巧,可能加剧了 UFE 中的能量泄漏问题,而 E2E-UFE 通过端到端优化缓解了该问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。