[论文解读] Mandarin-English Code-switching Speech Recognition with Self-supervised Speech Representation Models
本论文提出一种联合 CTC-LID 框架,利用自监督语音表征(wav2vec 2.0)以提升中文-英文代码切换语音识别性能。通过利用自监督模型中的帧级语言身份信息——即使其预训练仅使用英文数据——并联合微调 CTC 与语言识别模块,该方法在多语言预训练条件下实现了显著的准确率提升。
Code-switching (CS) is common in daily conversations where more than one language is used within a sentence. The difficulties of CS speech recognition lie in alternating languages and the lack of transcribed data. Therefore, this paper uses the recently successful self-supervised learning (SSL) methods to leverage many unlabeled speech data without CS. We show that hidden representations of SSL models offer frame-level language identity even if the models are trained with English speech only. Jointly training CTC and language identification modules with self-supervised speech representations improves CS speech recognition performance. Furthermore, using multilingual speech data for pre-training obtains the best CS speech recognition.
研究动机与目标
- 解决因转录数据有限而导致的低资源中文-英文代码切换语音识别挑战。
- 探究自监督语音表征模型(如 wav2vec 2.0)是否内在编码了帧级语言身份。
- 通过联合训练连接时序分类(CTC)与语言识别(LID)模块,提升代码切换语音识别性能。
- 评估预训练数据范围(单语 vs. 多语)对下游代码切换识别性能的影响。
- 证明预训练的 SSL 模型可有效将语言感知表征迁移至低资源代码切换场景。
提出的方法
- 将 wav2vec 2.0 用作特征提取器,利用其来自 7 层 CNN 和 Transformer 编码器的预训练隐藏表征。
- 训练一个独立的语言识别(LID)模块,通过强制对齐进行监督,将每个帧分类为中文、英文或静音。
- 实施一种联合 CTC-LID 框架,其中 CTC 与 LID 的 logits 通过在 softmax 归一化前相加融合:$ P(y|X,t) = \frac{\exp(\boldsymbol{z}_{t,y} + \boldsymbol{u}_{t,l(y)})}{\sum_{y'\in\mathcal{V}} \exp(\boldsymbol{z}_{t,y'} + \boldsymbol{u}_{t,l(y')})} $。
- 采用加权求和机制,将 wav2vec 2.0 多个层的表征进行融合,其中 CTC 与 LID 模块的权重可学习。
- 在预训练后联合微调 CTC 与 LID 模块,以改善对齐并提升性能,避免端到端联合训练带来的不稳定性。
- 比较不同训练策略:CTC 与 LID 分别训练、端到端联合训练,以及预训练模型的微调。
实验结果
研究问题
- RQ1在仅使用单语英文数据预训练的自监督语音表征模型中,是否仍能捕捉到代码切换语音的帧级语言身份?
- RQ2使用 SSL 特征联合训练 CTC 与 LID 模块,相较于独立的 CTC 模型,如何提升代码切换语音识别性能?
- RQ3多语言预训练对代码切换语音识别系统性能有何影响?
- RQ4CTC 与 LID 预测之间的对齐是否影响解码准确率,特别是在模糊或频繁切换的区域?
- RQ5预训练的 wav2vec 2.0 模型中哪些层对 CTC 与 LID 任务贡献最大?它们是否表现出相似的表征模式?
主要发现
- 在仅使用英文数据预训练的 wav2vec 2.0 自监督语音表征中,仍包含帧级语言身份信息,无需额外微调即可实现有效的语言识别。
- 利用预训练 SSL 特征联合训练 CTC 与 LID 模块可显著提升代码切换语音识别性能,尤其在两者共同微调时效果更优。
- 在多语言数据上进行预训练可获得最佳的代码切换语音识别性能,优于单语言预训练。
- 联合微调预训练的 CTC 与 LID 模块可实现更优的模块间对齐,并显著提升解码准确率,优于分别训练或从零开始训练。
- LID 模块可纠正 CTC 的错误——例如,在一个示例中,单词 "break" 在联合微调模型下被正确解码为英文,而非被误识别为中文字符 "不"。
- 加权求和机制表明,CTC 与 LID 任务依赖于 wav2vec 2.0 的相似隐藏层,表明两者在代码切换识别中共享对上下文表征的依赖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。