Skip to main content
QUICK REVIEW

[论文解读] Embedding-Based Speaker Adaptive Training of Deep Neural Networks

Xiaodong Cui, Vaibhava Goel|arXiv (Cornell University)|Oct 17, 2017
Speech Recognition and Synthesis参考文献 12被引用 7
一句话总结

该论文提出了一种基于嵌入的说话人自适应训练(SAT)方法,利用说话人 i-vector 通过控制网络生成逐层特定的、逐元素的仿射变换,对深度神经网络声学模型中的内部特征表示进行归一化。该方法联合优化主网络与控制网络,在交叉熵训练下于 Switchboard 数据集上实现 0.6% 的绝对 WER 改进,在 Callhome 数据集上实现 0.5% 的绝对 WER 改进,优于基于 i-vector 的说话人感知训练方法。

ABSTRACT

An embedding-based speaker adaptive training (SAT) approach is proposed and investigated in this paper for deep neural network acoustic modeling. In this approach, speaker embedding vectors, which are a constant given a particular speaker, are mapped through a control network to layer-dependent element-wise affine transformations to canonicalize the internal feature representations at the output of hidden layers of a main network. The control network for generating the speaker-dependent mappings is jointly estimated with the main network for the overall speaker adaptive acoustic modeling. Experiments on large vocabulary continuous speech recognition (LVCSR) tasks show that the proposed SAT scheme can yield superior performance over the widely-used speaker-aware training using i-vectors with speaker-adapted input features.

研究动机与目标

  • 为解决深度神经网络声学建模中的说话人差异问题,该问题会导致协变量偏移并降低自动语音识别(ASR)性能。
  • 通过在隐藏层之间规范化内部特征表示,提升 DNN 的说话人不变性。
  • 开发一种联合训练框架,将基于说话人嵌入的仿射变换整合到主网络的隐藏层中。
  • 超越现有方法,如基于 i-vector 的说话人感知训练和输入特征自适应方法。
  • 探索利用说话人嵌入生成细粒度、逐层特定的归一化变换的可行性。

提出的方法

  • 使用说话人 i-vector 作为固定长度的嵌入,表示每个说话人的声学特征。
  • 控制网络将每个说话人的 i-vector 映射为特定层的缩放向量(a)和偏置向量(b),用于逐元素仿射变换。
  • 仿射变换应用于选定的隐藏层输出:ŝ = a ⊙ x ⊕ b,其中 ⊙ 和 ⊕ 分别表示逐元素乘法和加法操作。
  • 控制网络与主 DNN 联合训练,以优化声学建模目标,实现端到端自适应。
  • 该方法在主网络架构的底层三个 LSTM 层之后应用归一化。
  • 该方法在 Babel 和 Switchboard LVCSR 数据集上,采用交叉熵和序列训练准则进行评估。

实验结果

研究问题

  • RQ1基于说话人嵌入的仿射变换是否能通过规范化内部特征空间,提升 DNN 声学模型的性能?
  • RQ2基于嵌入的 SAT 与基于 i-vector 的说话人感知训练(使用自适应输入特征)相比表现如何?
  • RQ3控制网络与主网络的联合优化是否比单独适应方法带来更好的说话人不变性?
  • RQ4该方法是否能在不同训练准则(如交叉熵和最小贝叶斯风险,sMBR)下实现泛化?
  • RQ5在多个隐藏层应用 SAT 与仅在输入或输出层应用相比,效果有何差异?

主要发现

  • 所提出的基于嵌入的 SAT 在交叉熵训练下,于 Switchboard 数据集上实现 0.6% 的绝对 WER 降低(从 8.1% 降至 7.5%)。
  • 在 Callhome 数据集上,该方法在交叉熵训练下实现 0.5% 的绝对 WER 降低(从 13.5% 降至 13.0%)。
  • 在 sMBR 序列训练后,该方法在 Switchboard 上实现 0.1% 的绝对 WER 改进(从 7.2% 降至 7.1%),在 Callhome 上实现 0.2% 的绝对 WER 改进(从 12.7% 降至 12.5%)。
  • 性能提升在交叉熵和序列训练下均保持一致,表明对训练目标具有鲁棒性。
  • 该方法优于基于 i-vector 的说话人感知训练(使用自适应输入特征),证明了内部特征空间归一化的优势。
  • 控制网络成功学习到与说话人相关的变换,提升了模型在不同说话人之间的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。