Skip to main content
QUICK REVIEW

[论文解读] Joint Speaker Counting, Speech Recognition, and Speaker Identification for Overlapped Speech of Any Number of Speakers

Naoyuki Kanda, Yashesh Gaur|arXiv (Cornell University)|Jun 19, 2020
Speech Recognition and Synthesis参考文献 33被引用 5
一句话总结

本文提出一种端到端联合模型用于说话人标注自动语音识别(SA-ASR),可同时对单耳重叠语音进行说话人计数、多说话人ASR和说话人识别。该模型基于带注意力机制的编码器-解码器的序列输出训练(SOT),引入说话人语料库作为辅助输入,并通过说话人标注最大互信息准则联合优化所有组件,在SA-WER上相比基线系统实现29%的相对降低。

ABSTRACT

We propose an end-to-end speaker-attributed automatic speech recognition model that unifies speaker counting, speech recognition, and speaker identification on monaural overlapped speech. Our model is built on serialized output training (SOT) with attention-based encoder-decoder, a recently proposed method for recognizing overlapped speech comprising an arbitrary number of speakers. We extend SOT by introducing a speaker inventory as an auxiliary input to produce speaker labels as well as multi-speaker transcriptions. All model parameters are optimized by speaker-attributed maximum mutual information criterion, which represents a joint probability for overlapped speech recognition and speaker identification. Experiments on LibriSpeech corpus show that our proposed method achieves significantly better speaker-attributed word error rate than the baseline that separately performs overlapped speech recognition and speaker identification.

研究动机与目标

  • 解决在单耳重叠语音中端到端联合建模说话人计数、多说话人ASR和说话人识别的挑战。
  • 克服级联系统分别执行语音分离、ASR和说话人分割所带来的局限性,这些系统常因误差传播导致性能次优。
  • 实现在任意数量说话人重叠语音中的识别,同时能从可变大小的说话人档案语料库中准确识别每个说话人。
  • 将所有组件——说话人计数、转录和识别——统一在一个可微分的联合概率框架中进行优化。
  • 证明通过说话人标注最大互信息(SA-MMI)进行联合优化,可提升SA-WER性能,优于流水线基线系统。

提出的方法

  • 将序列输出训练(SOT)与注意力机制编码器-解码器(AED)扩展,通过在转录中连接说话人切换标记(<sc>)来处理任意数量的重叠说话人。
  • 引入说话人语料库作为辅助输入,其中每个档案通过参考语音中的d-vector表示。
  • 使用说话人查询RNN生成动态查询,以关注说话人档案,提升说话人识别准确率。
  • 应用语料库注意力机制,利用查询向量关注说话人档案,生成用于说话人感知解码的上下文向量。
  • 在注意力机制中引入加权说话人档案表示 $\bar{d}_n$,以在解码过程中优化说话人识别。
  • 通过说话人标注最大互信息(SA-MMI)准则联合优化所有模型参数,以最大化转录与说话人标签的联合似然。
Figure 1: Proposed model.
Figure 1: Proposed model.

实验结果

研究问题

  • RQ1统一的端到端模型能否在单耳重叠语音中联合执行说话人计数、多说话人ASR和说话人识别?
  • RQ2将说话人档案作为辅助输入整合到SOT中,是否能提升说话人标注准确率并降低SA-WER,相比独立模块的流水线?
  • RQ3该方法在说话人档案数量和每档案语音数量增加时的可扩展性如何?
  • RQ4在复杂、高重叠度的场景下,模型能否准确计数说话人并正确分配标签?
  • RQ5通过SA-MMI进行联合优化,是否优于使用信号级准则分别训练各组件?

主要发现

  • 所提模型在SA-WER上相比基线系统(SOT-ASR与d-vector说话人识别组合)实现了29%的相对降低。
  • 1人说话人混合的说话人计数准确率为99.96%,2人混合为97.44%,但在3人混合情况下偶尔出现低估说话人数量的情况。
  • 模型对增加的说话人档案数量表现出鲁棒性,当档案数量从8个增至32个时,SER与SA-WER仅出现轻微下降。
  • 使用更多语音样本提取说话人档案可降低错误率,表明说话人嵌入质量得到提升。
  • 消融实验证实,包含说话人查询RNN与加权档案表示的完整模型优于其他变体,证明动态查询生成与档案优化的重要性。
  • 通过SA-MMI准则进行联合优化,实现了有效的端到端训练,克服了随机初始化带来的收敛问题,并整体提升了性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。