Skip to main content
QUICK REVIEW

[论文解读] Back-Translation-Style Data Augmentation for End-to-End ASR

Tomoki Hayashi, Shinji Watanabe|arXiv (Cornell University)|Jul 28, 2018
Natural Language Processing Techniques被引用 5
一句话总结

本文提出了一种面向端到端自动语音识别(E2E-ASR)的类回译数据增强方法,通过训练一个文本到编码器(TTE)模型,利用未配对的文本数据预测预训练E2E-ASR编码器的隐藏状态,从而生成合成隐藏状态作为额外训练数据。该方法在无需配对语音-文本数据的情况下,显著提升了ASR解码器的性能并降低了未知词率。在LibriSpeech数据集上的实验表明,词错误率(CER)和字错误率(WER)均有显著提升。

ABSTRACT

In this paper we propose a novel data augmentation method for attention-based end-to-end automatic speech recognition (E2E-ASR), utilizing a large amount of text which is not paired with speech signals. Inspired by the back-translation technique proposed in the field of machine translation, we build a neural text-to-encoder model which predicts a sequence of hidden states extracted by a pre-trained E2E-ASR encoder from a sequence of characters. By using hidden states as a target instead of acoustic features, it is possible to achieve faster attention learning and reduce computational cost, thanks to sub-sampling in E2E-ASR encoder, also the use of the hidden states can avoid to model speaker dependencies unlike acoustic features. After training, the text-to-encoder model generates the hidden states from a large amount of unpaired text, then E2E-ASR decoder is retrained using the generated hidden states as additional training data. Experimental evaluation using LibriSpeech dataset demonstrates that our proposed method achieves improvement of ASR performance and reduces the number of unknown words without the need for paired data.

研究动机与目标

  • 利用未与语音信号配对的大规模未配对文本,提升端到端ASR性能。
  • 解决基于注意力机制的E2E-ASR模型因缺乏独立语言模型模块而难以利用大规模未配对文本的问题。
  • 通过使用隐藏状态作为目标而非原始声学特征,降低计算成本并加速注意力机制的训练过程。
  • 通过利用子采样后的编码器表征,减轻合成数据生成过程中的过拟合与说话人特异性偏差。
  • 在无需文本到语音合成或基于音素的生成流程的情况下,实现有效的数据增强。

提出的方法

  • 训练一个文本到编码器(TTE)模型,从字符序列预测预训练E2E-ASR编码器的隐藏状态。
  • 使用从子采样编码器输出中提取的隐藏状态作为目标,而非原始声学特征,以降低计算成本并避免建模说话人差异。
  • 通过结合均方误差和L1范数损失函数训练TTE模型,以加快注意力学习速度并防止出现自编码器式的行为。
  • 利用训练好的TTE模型,从大规模未配对文本语料中生成合成隐藏状态。
  • 使用原始训练数据和生成的隐藏状态作为额外监督信号,重新训练E2E-ASR解码器。
  • 将所提方法与基于字符的语言模型进行浅层融合,以进一步提升识别性能。
Fig. 1 : Overview of proposed back-translation-style data augmentation method.
Fig. 1 : Overview of proposed back-translation-style data augmentation method.

实验结果

研究问题

  • RQ1未配对的文本能否在不依赖配对语音-文本数据的情况下,有效提升端到端ASR的性能?
  • RQ2在文本到编码器模型中,使用ASR编码器的隐藏状态作为目标,是否相比使用原始声学特征能实现更快、更高效的注意力学习?
  • RQ3通过类回译方法生成的合成数据,能否有效减少ASR识别中的未知词数量?
  • RQ4与使用声学特征相比,使用隐藏状态作为目标如何影响合成数据中模型的泛化能力与说话人差异性?
  • RQ5所提方法能否与现有语言模型集成技术(如浅层融合)有效结合?

主要发现

  • 在LibriSpeech验证集上,该方法将词错误率(WER)从23.0%降低至21.6%;在测试集上,从22.9%降至22.0%,当与语言模型结合时表现更优。
  • 在TTE模型的目标函数中引入L1范数损失,显著加速了注意力学习,使有效注意力机制的训练时间缩短至仅使用均方误差损失时的三分之一以下。
  • 仅使用生成的隐藏状态重新训练解码器导致过拟合且性能未提升,表明必须将合成数据与原始数据结合使用。
  • 通过合成数据利用解码器的语言模型容量,成功减少了未知词数量,提升了词汇覆盖率。
  • 该方法与浅层融合兼容,与基于字符的语言模型结合后,验证集和测试集上的识别性能均进一步提升。
  • 结果表明,生成隐藏状态中的说话人差异性有限,未来工作应引入多说话人建模以提升数据多样性。
(a) Attetion-based ASR model
(a) Attetion-based ASR model

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。