Skip to main content
QUICK REVIEW

[论文解读] Single-Channel Multi-talker Speech Recognition with Permutation Invariant Training

Yanmin Qian, Xuankai Chang|arXiv (Cornell University)|Jul 19, 2017
Speech Recognition and Synthesis被引用 3
一句话总结

本文提出一种基于排列不变训练(PIT)的方法,用于单通道多说话人语音识别,直接在端到端联合框架中优化说话人分离与识别。通过分别在前端特征分离(使用均方误差)和后端自动语音识别(ASR)(使用交叉熵)中应用PIT,该方法有效解决了标签排列问题,在双说话人和三说话人混合语音中分别实现了45.0%和25.0%的相对WER降低,且在不同说话人数下表现出强大的泛化能力。

ABSTRACT

Although great progresses have been made in automatic speech recognition (ASR), significant performance degradation is still observed when recognizing multi-talker mixed speech. In this paper, we propose and evaluate several architectures to address this problem under the assumption that only a single channel of mixed signal is available. Our technique extends permutation invariant training (PIT) by introducing the front-end feature separation module with the minimum mean square error (MSE) criterion and the back-end recognition module with the minimum cross entropy (CE) criterion. More specifically, during training we compute the average MSE or CE over the whole utterance for each possible utterance-level output-target assignment, pick the one with the minimum MSE or CE, and optimize for that assignment. This strategy elegantly solves the label permutation problem observed in the deep learning based multi-talker mixed speech separation and recognition systems. The proposed architectures are evaluated and compared on an artificially mixed AMI dataset with both two- and three-talker mixed speech. The experimental results indicate that our proposed architectures can cut the word error rate (WER) by 45.0% and 25.0% relatively against the state-of-the-art single-talker speech recognition system across all speakers when their energies are comparable, for two- and three-talker mixed speech, respectively. To our knowledge, this is the first work on the multi-talker mixed speech recognition on the challenging speaker-independent spontaneous large vocabulary continuous speech task.

研究动机与目标

  • 为解决从单通道输入中识别多说话人混合语音的挑战,其中说话人身份不明确。
  • 克服基于深度学习的多说话人ASR系统中的标签排列问题,该问题阻碍了可靠训练与推理。
  • 开发一种统一的端到端架构,联合优化特征分离与语音识别,无需显式分离阶段。
  • 在真实条件下,于说话人无关、自发性、大词汇量连续语音任务上评估该模型。
  • 展示该模型在不同说话人数下的泛化能力,包括使用三说话人模型识别双说话人混合语音。

提出的方法

  • 分别在前端特征分离和后端ASR中应用排列不变训练(PIT),分别采用最小均方误差(MSE)和最小交叉熵(CE)准则。
  • 对于每个语音样本,计算所有可能输出-目标说话人分配下的损失,并选择误差最小的分配用于优化。
  • 提出一种直接的PIT-CE-ASR模型,通过直接预测每个说话人的音素后验概率,绕过显式语音分离过程。
  • 采用联合优化架构,在统一的训练目标下结合前端分离与后端识别。
  • 使用单通道混合语音输入,利用深度神经网络在无先验说话人信息的情况下建模说话人特定表示。
  • 在人工混合的AMI数据集上评估模型,涵盖双说话人和三说话人场景,变化说话人能量水平与性别组合。

实验结果

研究问题

  • RQ1排列不变训练能否有效从语音分离扩展到端到端多说话人语音识别?
  • RQ2通过PIT联合优化特征分离与ASR是否相比分离训练阶段能提升识别性能?
  • RQ3当该模型应用于与训练时说话人数不同的混合语音时,其泛化能力如何?
  • RQ4在具有挑战性的多说话人场景中,该方法相比最先进单说话人ASR系统的表现增益如何?
  • RQ5该模型在不同说话人能量水平与性别组合下是否保持鲁棒性?

主要发现

  • 所提出的直接PIT-CE-ASR模型在双说话人混合语音(说话人能量相近)上相比最先进单说话人ASR系统,实现了45.0%的相对词错误率(WER)降低。
  • 在三说话人混合语音中,该模型在相同能量条件下对所有说话人均实现了25.0%的相对WER降低。
  • 三说话人PIT-CE-ASR模型在双说话人混合语音上表现出良好泛化能力,WER与专用双说话人模型几乎相同,表明对说话人数变化具有鲁棒性。
  • 在不同性别混合语音中性能更优(例如,不同性别三说话人混合的WER为64.80%),而在同性别混合中性能较差(例如,同性别三说话人混合的WER为69.78%),表明性别多样性有助于识别。
  • 即使在低信噪比(SNR)条件下,该模型仍保持强性能,三说话人混合语音在15dB和20dB SNR下的WER分别为72.88%和81.63%。
  • 据作者所知,这是首个在单通道输入下成功实现说话人无关、自发性、大词汇量连续语音识别的端到端系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。