Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Speaker Adaptation using Attention-based Speaker Memory for End-to-End ASR

Leda Sarı, Niko Moritz|arXiv (Cornell University)|Feb 14, 2020
Speech Recognition and Synthesis参考文献 30被引用 4
一句话总结

本文提出了一种基于注意力机制的说话人记忆的无监督端到端自动语音识别(ASR)说话人自适应方法,其灵感源自神经图灵机。该模型在内存库中存储训练数据中的说话人 i-向量,并利用注意力机制在帧级别动态检索并组合相关的说话人表征(M-向量),随后将这些 M-向量拼接至声学特征或隐藏层。该方法在无需测试时说话人嵌入或自适应数据的情况下,实现了与 i-向量基线相当或更优的词错误率,尤其在说话人切换场景下表现更优。

ABSTRACT

We propose an unsupervised speaker adaptation method inspired by the neural Turing machine for end-to-end (E2E) automatic speech recognition (ASR). The proposed model contains a memory block that holds speaker i-vectors extracted from the training data and reads relevant i-vectors from the memory through an attention mechanism. The resulting memory vector (M-vector) is concatenated to the acoustic features or to the hidden layer activations of an E2E neural network model. The E2E ASR system is based on the joint connectionist temporal classification and attention-based encoder-decoder architecture. M-vector and i-vector results are compared for inserting them at different layers of the encoder neural network using the WSJ and TED-LIUM2 ASR benchmarks. We show that M-vectors, which do not require an auxiliary speaker embedding extraction system at test time, achieve similar word error rates (WERs) compared to i-vectors for single speaker utterances and significantly lower WERs for utterances in which there are speaker changes.

研究动机与目标

  • 为解决测试说话人与训练说话人不一致时端到端 ASR 性能下降的问题。
  • 开发一种无需测试时说话人标签或 i-向量计算的无监督、帧级说话人自适应方法。
  • 探究在编码器中间层而非仅输入特征上进行说话人自适应的有效性。
  • 评估该方法在说话人切换条件下的鲁棒性,这是现实世界中的常见挑战。
  • 探索记忆增强网络在端到端 ASR 中说话人表征学习方面的潜力。

提出的方法

  • 该模型使用一个内存库,存储从训练数据中提取的说话人 i-向量。
  • 注意力机制基于当前声学上下文对内存项计算权重,生成加权组合的 i-向量,称为 M-向量。
  • M-向量被拼接至输入声学特征或中间编码器层的输出,之后被投影进入网络。
  • 该方法应用于在 WSJ 和 TED-LIUM2 数据集上训练的联合 CTC 与注意力机制编码器-解码器端到端 ASR 架构。
  • 内存读取操作受到神经图灵机的启发,实现了动态、上下文相关的说话人表征自适应。
  • 该方法为无监督:无需测试时的说话人信息或 i-向量提取,因为内存由训练数据固定。

实验结果

研究问题

  • RQ1基于注意力机制的记忆机制是否能在不依赖测试时说话人标签的情况下提升端到端 ASR 性能?
  • RQ2在端到端 ASR 中,对中间编码器层进行自适应是否优于仅对输入特征进行自适应?
  • RQ3在词错误率方面,所提出的 M-向量方法与基于 i-向量的自适应相比如何,尤其是在说话人切换条件下?
  • RQ4记忆增强的说话人自适应机制是否能在无显式自适应数据的情况下实现对说话人切换的鲁棒性?
  • RQ5使用说话人级与话语级 i-向量对自适应性能有何影响?M-向量方法与之相比如何?

主要发现

  • 当在第三编码器层进行自适应时,M-向量方法在 TED-LIUM2 测试集上实现了 11.0% 的词错误率(WER),与最佳 i-向量性能相当。
  • 对于经过合成说话人切换的语音,M-向量系统相比 i-向量基线实现了 4% 的绝对词错误率降低(15.9% → 11.9%)。
  • 在测试集上,M-向量方法相比话语级 i-向量系统相对提升了 6.8%(11.8% → 11.0% WER)。
  • 对第三编码器层进行自适应在 i-向量和 M-向量方法中均取得了最佳性能,表明中间层自适应比输入层自适应更有效。
  • M-向量方法在无需任何测试时 i-向量计算的情况下,达到了与说话人级 i-向量相当的性能,证明了其无监督和高效的特点。
  • 该方法在说话人切换方面表现出更优的鲁棒性,证实了基于注意力机制的内存读取机制所支持的帧级自适应具有优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。