Skip to main content
QUICK REVIEW

[论文解读] Dynamic Layer Normalization for Adaptive Neural Acoustic Modeling in Speech Recognition

Taesup Kim, Inchul Song|arXiv (Cornell University)|Jul 19, 2017
Speech Recognition and Synthesis参考文献 22被引用 12
一句话总结

本文提出动态层归一化(DLN),一种新颖的自适应归一化技术,可根据输入语音序列动态生成层归一化中的缩放和偏移参数,使神经声学模型能够在无需适应数据或说话人身份信息的情况下适应说话人和环境变化。DLN在TED-LIUM语料库上将词错误率相对降低最高达10.7%,证明了在固定模型尺寸下无需外部监督即可实现有效适应。

ABSTRACT

Layer normalization is a recently introduced technique for normalizing the activities of neurons in deep neural networks to improve the training speed and stability. In this paper, we introduce a new layer normalization technique called Dynamic Layer Normalization (DLN) for adaptive neural acoustic modeling in speech recognition. By dynamically generating the scaling and shifting parameters in layer normalization, DLN adapts neural acoustic models to the acoustic variability arising from various factors such as speakers, channel noises, and environments. Unlike other adaptive acoustic models, our proposed approach does not require additional adaptation data or speaker information such as i-vectors. Moreover, the model size is fixed as it dynamically generates adaptation parameters. We apply our proposed DLN to deep bidirectional LSTM acoustic models and evaluate them on two benchmark datasets for large vocabulary ASR experiments: WSJ and TED-LIUM release 2. The experimental results show that our DLN improves neural acoustic models in terms of transcription accuracy by dynamically adapting to various speakers and environments.

研究动机与目标

  • 解决当神经声学模型应用于未见说话人或环境时语音识别准确率下降的问题。
  • 开发一种参数高效的适应方法,无需额外的适应数据或类似i-向量的说话人嵌入。
  • 通过在线学习生成归一化参数,在固定大小模型内实现动态、输入相关的适应。
  • 在多样化的声学条件下提升大规模词汇量语音识别的泛化能力。

提出的方法

  • 使用前馈神经网络基于输入语音的摘要特征生成层归一化的缩放和偏移参数。
  • 语音摘要特征源自输入序列,并用于在每一层动态调制归一化参数。
  • 整个模型,包括参数生成器,通过反向传播和梯度下降进行端到端联合训练。
  • 该方法利用层归一化的不变性,通过动态参数生成引入对说话人和环境的感知适应。
  • 通过不存储与说话人相关的参数,避免模型扩展,保持固定模型尺寸。
  • 该方法应用于深度双向LSTM声学模型,并在WSJ和TED-LIUM数据集上进行评估。

实验结果

研究问题

  • RQ1是否可以在不依赖适应数据的情况下,对层归一化进行动态适应以应对说话人和环境变化?
  • RQ2通过动态生成归一化参数,能否提升神经声学模型在多样化说话人和环境下的泛化能力?
  • RQ3所提方法是否在不增加模型尺寸的前提下,优于标准层归一化或基线模型?
  • RQ4模型是否能仅从输入序列中学习到与说话人相关的表征,而无需显式说话人标签?

主要发现

  • 在TED-LIUM发布2版数据集上,DLN相比基线模型在词错误率上实现了10.7%的相对提升。
  • 在WSJ语料库上,DLN在开发集上将帧错误率降低了1.7%,在测试集上降低了1.8%,尽管词错误率的提升不那么显著。
  • t-SNE可视化显示,第一层的语音摘要特征形成了与说话人身份对应的聚类,即使没有说话人标签。
  • 第三层的特征分布更分散,表明更高层捕获了非说话人因素(如环境变化)。
  • 更大的基线模型在层数更多时过拟合更严重,而DLN通过动态适应有效利用了增加的模型容量。
  • 该方法在训练过程中表现出比标准模型更快的收敛速度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。