[论文解读] Serialized Output Training for End-to-End Overlapped Speech Recognition
本文提出了一种新型端到端多说话人重叠语音识别框架——序列化输出训练(SOT),通过单个输出层依次生成转录文本,克服了排列不变性训练(PIT)在固定说话人数和缺乏说话人间依赖建模方面的局限。SOT在LibriSpeech数据集上实现了最先进(SOTA)的词错误率(WER)表现,优于PIT在不同说话人数下的性能,并在双说话人场景下实现了97%的说话人数量识别准确率。
This paper proposes serialized output training (SOT), a novel framework for multi-speaker overlapped speech recognition based on an attention-based encoder-decoder approach. Instead of having multiple output layers as with the permutation invariant training (PIT), SOT uses a model with only one output layer that generates the transcriptions of multiple speakers one after another. The attention and decoder modules take care of producing multiple transcriptions from overlapped speech. SOT has two advantages over PIT: (1) no limitation in the maximum number of speakers, and (2) an ability to model the dependencies among outputs for different speakers. We also propose a simple trick that allows SOT to be executed in $O(S)$, where $S$ is the number of the speakers in the training sample, by using the start times of the constituent source utterances. Experimental results on LibriSpeech corpus show that the SOT models can transcribe overlapped speech with variable numbers of speakers significantly better than PIT-based models. We also show that the SOT models can accurately count the number of speakers in the input audio.
研究动机与目标
- 为解决排列不变性训练(PIT)在多说话人重叠语音识别中的局限性,包括固定说话人数限制以及无法建模说话人间依赖关系的问题。
- 开发一种可扩展的端到端自动语音识别(ASR)框架,能够对任意数量说话人的重叠语音进行转录。
- 提升单通道、多说话人重叠语音场景下的转录准确率与说话人数量识别能力。
- 与PIT相比,降低计算复杂度,尤其是在说话人数较多时。
提出的方法
- SOT采用基于注意力机制的编码器-解码器(AED)模型,通过单个输出头依次生成多个说话人的转录内容。
- 模型使用特殊的<sc>标记来标识说话人切换,使解码器能够区分来自不同说话人的语音片段。
- 关键创新在于利用源语音片段的起始时间,实现在O(S)时间复杂度下的推理,其中S为说话人数。
- 该框架利用注意力机制在编码器表征中来回扫描时间维度,使其能够关注来自多个重叠说话人的相关语音段。
- SOT引入了说话人感知注意力(SAA)模块,通过引入说话人特定的上下文信息来增强注意力机制,从而提升性能。
- 模型采用序列到序列的训练目标,使用按说话人起始时间排序的真实转录文本进行训练。
实验结果
研究问题
- RQ1单输出AED模型是否能有效转录可变数量说话人的重叠语音,且性能优于PIT?
- RQ2SOT通过顺序生成说话人输出,是否相比PIT中独立输出头的方式,能更好地建模说话人间的依赖关系?
- RQ3SOT是否能通过利用语音片段的起始时间,实现O(S)复杂度的高效推理?
- RQ4SOT在多说话人重叠语音输入中,多大程度上能准确估计说话人数?
- RQ5在不同说话人数下,SOT与PIT在词错误率(WER)上的表现如何比较?
主要发现
- SOT在单说话人测试集上达到4.6%的WER,在双说话人测试集上为11.2%,在三说话人测试集上为24.0%,显著优于基于PIT的模型。
- 在双说话人混合语音场景下,SOT的WER为11.2%,优于PIT的11.9%,且参数量更少(135.6M vs. 160.7M)。
- SOT对可变说话人数表现出强鲁棒性,在单说话人数据上无性能下降,甚至在某些情况下优于单说话人ASR模型。
- SOT在单说话人输入中实现了99.8%的说话人计数准确率,在双说话人输入中达到97.0%,表明其具备强大的说话人数估计能力。
- 三说话人SOT的训练速度比双输出PIT快约30%,且在更高说话人数时性能差距进一步扩大。
- 引入说话人感知注意力(SAA)模块后,性能进一步提升,使1,2,3说话人测试集的WER降至16.5%,且模型参数更小。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。