[论文解读] Decoupling Pronunciation and Language for End-to-end Code-switching Automatic Speech Recognition
本文提出一种解耦的Transformer模型,将端到端的多语种切换语音识别(ASR)分解为两个阶段:音视频到音素(A2P)和音素到文本(P2T)网络。通过在单语配对数据上预训练A2P网络,在无配对文本数据上预训练P2T网络,并通过注意力融合进行联合优化,该模型在普通话-英语多语种切换数据上实现了18.14%的相对错误率降低,显著减少了对稀缺的多语种切换语音-文本配对数据的依赖。
Despite the recent significant advances witnessed in end-to-end (E2E) ASR system for code-switching, hunger for audio-text paired data limits the further improvement of the models' performance. In this paper, we propose a decoupled transformer model to use monolingual paired data and unpaired text data to alleviate the problem of code-switching data shortage. The model is decoupled into two parts: audio-to-phoneme (A2P) network and phoneme-to-text (P2T) network. The A2P network can learn acoustic pattern scenarios using large-scale monolingual paired data. Meanwhile, it generates multiple phoneme sequence candidates for single audio data in real-time during the training process. Then the generated phoneme-text paired data is used to train the P2T network. This network can be pre-trained with large amounts of external unpaired text data. By using monolingual data and unpaired text data, the decoupled transformer model reduces the high dependency on code-switching paired training data of E2E model to a certain extent. Finally, the two networks are optimized jointly through attention fusion. We evaluate the proposed method on the public Mandarin-English code-switching dataset. Compared with our transformer baseline, the proposed method achieves 18.14% relative mix error rate reduction.
研究动机与目标
- 解决端到端多语种切换语音识别中多语种切换语音-文本配对数据稀缺的问题。
- 降低端到端模型对昂贵且有限的多语种切换训练数据的依赖。
- 有效利用单语配对数据和无配对文本数据于多语种切换语音识别中。
- 在提升性能的同时,保持训练和推理的简洁性。
提出的方法
- 该模型被解耦为音视频到音素(A2P)网络和音素到文本(P2T)网络。
- A2P网络使用连接时序分类(CTC)准则在单语配对数据上进行预训练,使其能够独立于语言上下文学习声学模式。
- 在训练过程中,A2P网络可实时为每个音频输入生成多个音素序列候选。
- 生成的音素-文本配对用于训练P2T网络,该网络在大规模无配对文本数据上进行预训练。
- 采用多级注意力机制以降低联合优化过程中的计算成本。
- 通过注意力融合,对两个网络进行联合优化,以改善对齐效果并提升性能。

实验结果
研究问题
- RQ1能否在不依赖多语种切换配对数据的情况下,有效利用单语配对数据来提升多语种切换语音识别性能?
- RQ2能否利用无配对文本数据对多语种切换语音识别系统中的语言建模组件进行预训练?
- RQ3解耦声学建模与语言建模组件是否能降低对稀缺多语种切换训练数据的依赖?
- RQ4通过注意力融合联合优化A2P与P2T网络,是否能在保持端到端训练和推理简洁性的同时提升性能?
主要发现
- 与Transformer基线模型相比,所提模型在普通话-英语多语种切换数据集上实现了18.14%的相对错误率降低。
- 在使用外部数据时,该模型将英语的相对词错误率(WER)降低了9.39%,中文的字符错误率(CER)降低了9.78%。
- 在500小时中文单语数据和460小时英文单语数据上预训练A2P网络,相比仅使用多语种切换数据,可实现9.42%的相对词错误率(MER)降低。
- 消融实验证明,结合声学与音素信息的性能优于仅使用音素级建模,证实了多模态信息融合的优势。
- 尽管采用了解耦架构,该模型在训练和解码过程中仍保持了与标准端到端模型相似的简洁性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。