[论文解读] Independent language modeling architecture for end-to-end ASR
本文提出一种用于端到端自动语音识别(ASR)的解耦语言建模架构,将解码器子网络与编码器输出分离,从而实现使用外部文本数据进行独立预训练。通过解耦语言模型,该方法在普通话HKUST数据集上实现9.3%的相对字符错误率降低,在英语NSC数据集上实现22.8%的相对词错误率降低,且在不同规模的标注数据下均表现出更好的泛化能力,并兼容外部语言模型。
The attention-based end-to-end (E2E) automatic speech recognition (ASR) architecture allows for joint optimization of acoustic and language models within a single network. However, in a vanilla E2E ASR architecture, the decoder sub-network (subnet), which incorporates the role of the language model (LM), is conditioned on the encoder output. This means that the acoustic encoder and the language model are entangled that doesn't allow language model to be trained separately from external text data. To address this problem, in this work, we propose a new architecture that separates the decoder subnet from the encoder output. In this way, the decoupled subnet becomes an independently trainable LM subnet, which can easily be updated using the external text data. We study two strategies for updating the new architecture. Experimental results show that, 1) the independent LM architecture benefits from external text data, achieving 9.3% and 22.8% relative character and word error rate reduction on Mandarin HKUST and English NSC datasets respectively; 2)the proposed architecture works well with external LM and can be generalized to different amount of labelled data.
研究动机与目标
- 为解决原始端到端ASR中语言模型与声学编码器耦合导致无法使用外部文本数据独立训练的问题。
- 实现语言模型组件使用大规模外部文本语料进行有效预训练,而无需依赖转录语音数据。
- 在语言模型预训练后联合微调端到端模型时,缓解灾难性遗忘问题。
- 评估所提出架构在不同规模标注数据下的泛化能力,并验证其与外部语言模型的兼容性。
提出的方法
- 提出一种新架构(A2),将解码器子网络与编码器输出解耦,使解码器可作为独立语言模型运行。
- 修改注意力机制,使上下文向量由编码器输出和当前解码器隐藏状态共同计算,而非依赖上下文向量进行解码条件化。
- 引入两种训练策略:策略1在联合微调前先对解码器子网络进行外部文本数据预训练;策略2通过加权损失函数交替进行预训练与联合微调,结合ASR与语言建模目标。
- 使用带超参数α的加权损失函数,平衡训练过程中标注ASR数据与外部文本数据的贡献。
- 应用梯度裁剪与AdaDelta优化方法以稳定训练,尤其在缓解灾难性遗忘方面。
- 在推理阶段引入外部RNN-LM,评估独立语言模型与预训练外部语言模型之间的协同效应。
实验结果
研究问题
- RQ1将语言模型与编码器输出解耦后,是否能仅使用外部文本数据在端到端ASR中实现有效的预训练?
- RQ2当仅使用标注数据时,所提架构与原始端到端ASR在性能上相比如何?
- RQ3哪种训练策略最能有效缓解灾难性遗忘,同时利用外部文本数据提升语言模型性能?
- RQ4所提架构在不同规模的标注数据下是否具有良好的泛化能力?
- RQ5通过集成一个预训练的外部语言模型,是否能进一步增强独立语言模型的性能?
主要发现
- 在仅使用标注数据训练时,所提出的A2架构相较于原始A1架构,在HKUST和NSC数据集上分别实现1.8%的相对字符错误率降低(从49.2%降至48.3%)和4.3%的相对词错误率降低(从39.9%降至38.2%)。
- 使用外部文本数据并采用策略2(预训练后联合微调,α=0.7)时,A2模型在HKUST数据集上实现9.3%的相对字符错误率降低,在NSC数据集上实现22.8%的相对词错误率降低。
- A2架构配合策略2在所有设置下均表现最佳,优于使用外部文本的A1架构及A2架构配合策略1的设置。
- 在20小时标注数据的NSC语料上,集成外部RNN-LM使A2-Strategy2-0.7模型的字符错误率进一步降低0.2%(绝对值),词错误率降低4.5%(绝对值)。
- 所提架构在不同规模的标注数据下表现出良好的泛化能力,在NSC数据集上从20小时到60小时训练数据的范围内均保持一致的性能提升。
- 通过精心设计的训练调度,该方法成功缓解了灾难性遗忘,实现了在外部文本预训练后对端到端模型的有效联合优化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。