Skip to main content
QUICK REVIEW

[论文解读] Recognizing Multi-talker Speech with Permutation Invariant Training

Dong Yu, Xuankai Chang|arXiv (Cornell University)|Mar 22, 2017
Speech Recognition and Synthesis参考文献 31被引用 12
一句话总结

该论文提出了一种端到端多说话人语音识别的排列不变训练方法(PIT-ASR),直接从单通道混合音频中识别多个语音流,无需事先分离。通过最小化所有可能说话人-输出分配组合的交叉熵,并选择最优排列,PIT-ASR 联合解决了标签排列问题与说话人追踪问题,在 0dB SNR 条件下实现相对 WER 降低 40%,在 20dB SNR 条件下接近单说话人性能。

ABSTRACT

In this paper, we propose a novel technique for direct recognition of multiple speech streams given the single channel of mixed speech, without first separating them. Our technique is based on permutation invariant training (PIT) for automatic speech recognition (ASR). In PIT-ASR, we compute the average cross entropy (CE) over all frames in the whole utterance for each possible output-target assignment, pick the one with the minimum CE, and optimize for that assignment. PIT-ASR forces all the frames of the same speaker to be aligned with the same output layer. This strategy elegantly solves the label permutation problem and speaker tracing problem in one shot. Our experiments on artificially mixed AMI data showed that the proposed approach is very promising.

研究动机与目标

  • 解决从单通道混合语音信号中识别多个重叠语音流的挑战,而无需显式分离。
  • 通过统一的训练框架,解决多说话人 ASR 中固有的标签排列与说话人追踪问题。
  • 证明端到端训练结合排列不变损失可在低信噪比(SNR)条件下实现鲁棒识别。
  • 在人工混合的 AMI 数据上评估 PIT-ASR 的有效性,比较不同信噪比下的性能表现。

提出的方法

  • 模型采用深度双向 LSTM 架构,包含 4 层,每层 768 个单元,处理 40 维对数滤波器组特征。
  • 在真实与预测音素后验概率之间的交叉熵(CE)上应用排列不变训练(PIT),而非重建损失。
  • 对每个语音样本,评估所有可能的说话人-输出分配组合,并选择交叉熵最小的排列用于反向传播。
  • 训练使用 8 个语音样本的小批量(minibatch),并采用梯度裁剪(阈值 0.0003)以保证稳定性。
  • 推理阶段,两个输出独立解码,通过成对评分选择每个语音样本中 WER 更优的结果。
  • 两个说话人的音素对齐结果来自单说话人基线模型,短语音样本通过添加静音状态进行填充。

实验结果

研究问题

  • RQ1排列不变训练能否有效适配于无需显式语音分离的端到端多说话人语音识别?
  • RQ2当直接应用于混合多说话人语音时,PIT-ASR 是否优于传统单说话人模型?
  • RQ3PIT-ASR 的性能在高能与低能说话人中,随信噪比(SNR)降低如何变化?
  • RQ4PIT-ASR 是否能在同时识别多个说话人时,隐式实现语音分离?

主要发现

  • 在 0dB SNR 条件下,PIT-ASR 对高能说话人的 WER 为 49.74%,对低能说话人为 56.88%,相比基线实现 40% 的相对 WER 降低。
  • 在 20dB SNR 条件下,高能说话人的 WER(29.68%)接近单说话人基线(26.6%),表现出强鲁棒性。
  • 低能说话人性能显著提升,WER 从基线的 118.7% 降低至 20dB SNR 下的 80.83%,但性能仍受限。
  • 模型表现出隐式语音分离能力,可视化结果表明即使在低 SNR 条件下,两个说话人的单词识别均正确。
  • 随着 SNR 降低,高能说话人性能下降缓慢,而低能说话人性能急剧下降,凸显弱信号追踪的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。