[论文解读] Continuous Speech Separation with Conformer
该论文提出了一种基于 Conformer 的连续语音分离(CSS)模型,适用于单通道和多通道设置,通过自注意力机制和卷积模块捕捉长程与局部上下文,从而提升分离性能。该方法在 LibriCSS 数据集上取得了最先进结果,并在真实会议录音中实现了显著的 WER/SA-WER 改进,证明了 Conformer 在复杂真实对话场景中相较于 RNN 和 Transformer 的优越性。
Continuous speech separation plays a vital role in complicated speech related tasks such as conversation transcription. The separation model extracts a single speaker signal from a mixed speech. In this paper, we use transformer and conformer in lieu of recurrent neural networks in the separation system, as we believe capturing global information with the self-attention based method is crucial for the speech separation. Evaluating on the LibriCSS dataset, the conformer separation model achieves state of the art results, with a relative 23.5% word error rate (WER) reduction from bi-directional LSTM (BLSTM) in the utterance-wise evaluation and a 15.4% WER reduction in the continuous evaluation.
研究动机与目标
- 为解决真实对话中重叠语音的挑战,传统自动语音识别(ASR)系统在多说话人、重叠语音条件下表现失效。
- 探究 Conformer 架构是否在基于 RNN 的模型之上提升连续语音分离(CSS)性能。
- 评估 Conformer 在单通道和多通道设置下的有效性,尤其针对具有自然说话人交替与重叠的真实会议录音。
- 通过引入上下文感知建模增强语音分离,降低端到端对话转录中的词错误率(WER)和说话人归属词错误率(SA-WER)。
- 探索训练与推理技术,以缓解低重叠区域的性能下降,同时保持在高重叠场景下的性能增益。
提出的方法
- 模型采用 Conformer 架构作为分离网络,整合自注意力、卷积模块和前馈网络,以建模语音的局部与全局上下文。
- 输入特征包括短时傅里叶变换(STFT)幅度谱,多通道设置下还包含通道间相位差(IPD),单通道设置下仅使用 STFT,所有特征均按时间归一化。
- 通过深度神经网络(Conformer)预测每个说话人的掩码,利用掩码与混合 STFT 的逐元素相乘重建源信号。
- 对于多通道输入,对掩码后的信号应用 MVDR 波束成形,以提升分离质量。
- 引入一种融合方案,用于在仅一个说话人活跃时合并输出,减少残余噪声导致的词插入错误。
- 通过使用带噪单说话人目标进行噪声鲁棒性训练,使 ASR 模型能够处理残余噪声。
实验结果
研究问题
- RQ1Conformer 架构是否在单通道和多通道设置下均优于基于 RNN 的模型进行连续语音分离?
- RQ2Conformer 模型长程与局部上下文建模能力是否能提升在具有自然说话人重叠与交替的真实会议录音中的性能?
- RQ3使用更长的上下文窗口如何影响性能,特别是在高重叠场景中?
- RQ4与基线系统相比,基于 Conformer 的分离方法在真实对话转录中能将 WER 和 SA-WER 降低多少?
- RQ5为防止在低重叠区域性能下降,同时保持高重叠区域的增益,需要哪些训练与推理上的改进?
主要发现
- 基于 Conformer 的模型在 LibriCSS 数据集上实现了最先进性能,在单通道和多通道设置下均优于基于 RNN 的基线模型。
- 在 LibriCSS 数据集上,Conformer-base 模型在 219 小时训练数据下,相对 BLSTM 基线将 WER 降低 7.2%,SA-WER 降低 6.3%。
- 在 1500 小时训练数据下,Conformer-base 模型在真实会议数据集上相较无分离系统实现 11.8% 的相对 WER 降低和 18.4% 的相对 SA-WER 降低。
- Conformer-large 模型表现出更强鲁棒性,结合噪声感知训练与融合策略后,实现 13.7% 的相对 SA-WER 降低。
- 融合方案与噪声感知训练显著减少了词插入错误,并提升了真实会议转录性能,尤其在低重叠区域表现更优。
- 与 BLSTM 基线相比,Conformer 模型有效缓解了低重叠场景下的性能下降,后者在该类条件下错误率显著上升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。