Skip to main content
QUICK REVIEW

[论文解读] Improving Hybrid CTC/Attention End-to-end Speech Recognition with Pretrained Acoustic and Language Model

Keqi Deng, Songjun Cao|arXiv (Cornell University)|Dec 14, 2021
Speech Recognition and Synthesis被引用 6
一句话总结

该论文提出了一种基于CTC/注意力机制的混合预训练模型(Preformer)架构,该架构在端到端自动语音识别(ASR)系统中同时利用了预训练的wav2vec2.0声学模型(AM)和DistilGPT2语言模型(LM)。通过使用wav2vec2.0初始化编码器,并引入一个使用DistilGPT2初始化的一元交叉注意力解码器(OCD),该模型在AISHELL-1数据集上实现了4.6%的字符错误率(CER),相较于基线的纯Transformer模型相对减少了27%。

ABSTRACT

Recently, self-supervised pretraining has achieved impressive results in end-to-end (E2E) automatic speech recognition (ASR). However, the dominant sequence-to-sequence (S2S) E2E model is still hard to fully utilize the self-supervised pre-training methods because its decoder is conditioned on acoustic representation thus cannot be pretrained separately. In this paper, we propose a pretrained Transformer (Preformer) S2S ASR architecture based on hybrid CTC/attention E2E models to fully utilize the pretrained acoustic models (AMs) and language models (LMs). In our framework, the encoder is initialized with a pretrained AM (wav2vec2.0). The Preformer leverages CTC as an auxiliary task during training and inference. Furthermore, we design a one-cross decoder (OCD), which relaxes the dependence on acoustic representations so that it can be initialized with pretrained LM (DistilGPT2). Experiments are conducted on the AISHELL-1 corpus and achieve a $4.6\%$ character error rate (CER) on the test set. Compared with our vanilla hybrid CTC/attention Transformer baseline, our proposed CTC/attention-based Preformer yields $27\%$ relative CER reduction. To the best of our knowledge, this is the first work to utilize both pretrained AM and LM in a S2S ASR system.

研究动机与目标

  • 为解决如何在主流序列到序列端到端ASR系统中有效整合预训练声学模型和语言模型的挑战。
  • 克服标准注意力机制解码器因依赖声学表示而无法独立预训练的局限性。
  • 探究结合自监督预训练声学模型(如wav2vec2.0)与自回归预训练语言模型(如DistilGPT2)是否能显著提升ASR性能。
  • 设计一种新型架构,实现在统一可训练的端到端框架中充分利用预训练的声学模型和语言模型组件。
  • 在低资源、非英语ASR基准(AISHELL-1)上验证该方法的有效性。

提出的方法

  • 使用预训练的wav2vec2.0模型初始化编码器,以利用自监督语音表征。
  • 引入CTC分支作为辅助训练目标,以提升收敛性,并支持对所有可能的时间边界进行束搜索。
  • 提出一种一元交叉注意力解码器(OCD),仅使用一个多头交叉注意力层,降低对编码器输出的依赖,从而实现解码器的独立预训练。
  • 使用预训练的DistilGPT2模型初始化OCD解码器,将高质量的语言表征注入ASR系统。
  • 使用混合CTC/注意力损失端到端训练完整模型,结合序列到序列建模与CTC对齐的优势。
  • 应用知识蒸馏技术,将GPT2压缩为DistilGPT2,以实现高效且有效的语言模型初始化。

实验结果

研究问题

  • RQ1序列到序列ASR模型是否能在统一框架中有效利用预训练的声学模型(wav2vec2.0)和预训练的语言模型(DistilGPT2)?
  • RQ2在混合CTC/注意力Transformer ASR系统中,引入CTC分支是否能提升训练稳定性和推理性能?
  • RQ3一元交叉注意力解码器(OCD)架构是否足够减少对声学表示的依赖,从而实现使用如DistilGPT2这样的语言模型对解码器进行有效预训练?
  • RQ4在低资源语言识别任务中,使用英语wav2vec2.0进行跨语言预训练(用于普通话ASR)会产生何种影响?
  • RQ5与标准微调的外部语言模型或基线模型相比,所提出的Preformer在字符错误率(CER)上的性能表现如何?

主要发现

  • 所提出的Preformer在AISHELL-1测试集上实现了4.6%的字符错误率(CER),显著优于基线的纯混合CTC/注意力Transformer模型。
  • 与基线相比,Preformer实现了27%的相对CER降低,证明了声学模型与语言模型联合预训练的有效性。
  • 仅使用预训练的wav2vec2.0编码器(不使用OCD)即可将CER从6.3%降低至5.0%,表明声学模型预训练具有显著优势。
  • 使用DistilGPT2初始化OCD解码器可将CER从5.6%降低至4.6%,证实了在解码器中引入语言模型预训练的价值。
  • 消融实验表明,即使使用英语wav2vec2.0模型对编码器进行预训练,其性能仍优于随机初始化的Transformer编码器,表明具备跨语言迁移能力。
  • 通过浅层融合微调DistilGPT2作为外部语言模型,可将基线CER从5.9%降至5.7%,但所提出的OCD内部集成方法实现了4.3%的CER,显示出更高的集成效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。