Skip to main content
QUICK REVIEW

[论文解读] Mandarin-English Code-switching Speech Recognition with Self-supervised Speech Representation Models

Liang-Hsuan Tseng, Yu-Kuan Fu|arXiv (Cornell University)|Oct 7, 2021
Speech Recognition and Synthesis参考文献 30被引用 8
一句话总结

本论文提出一种联合 CTC-LID 框架,利用自监督语音表征(wav2vec 2.0)以提升中文-英文代码切换语音识别性能。通过利用自监督模型中的帧级语言身份信息——即使其预训练仅使用英文数据——并联合微调 CTC 与语言识别模块,该方法在多语言预训练条件下实现了显著的准确率提升。

ABSTRACT

Code-switching (CS) is common in daily conversations where more than one language is used within a sentence. The difficulties of CS speech recognition lie in alternating languages and the lack of transcribed data. Therefore, this paper uses the recently successful self-supervised learning (SSL) methods to leverage many unlabeled speech data without CS. We show that hidden representations of SSL models offer frame-level language identity even if the models are trained with English speech only. Jointly training CTC and language identification modules with self-supervised speech representations improves CS speech recognition performance. Furthermore, using multilingual speech data for pre-training obtains the best CS speech recognition.

研究动机与目标

  • 解决因转录数据有限而导致的低资源中文-英文代码切换语音识别挑战。
  • 探究自监督语音表征模型(如 wav2vec 2.0)是否内在编码了帧级语言身份。
  • 通过联合训练连接时序分类(CTC)与语言识别(LID)模块,提升代码切换语音识别性能。
  • 评估预训练数据范围(单语 vs. 多语)对下游代码切换识别性能的影响。
  • 证明预训练的 SSL 模型可有效将语言感知表征迁移至低资源代码切换场景。

提出的方法

  • 将 wav2vec 2.0 用作特征提取器,利用其来自 7 层 CNN 和 Transformer 编码器的预训练隐藏表征。
  • 训练一个独立的语言识别(LID)模块,通过强制对齐进行监督,将每个帧分类为中文、英文或静音。
  • 实施一种联合 CTC-LID 框架,其中 CTC 与 LID 的 logits 通过在 softmax 归一化前相加融合:$ P(y|X,t) = \frac{\exp(\boldsymbol{z}_{t,y} + \boldsymbol{u}_{t,l(y)})}{\sum_{y'\in\mathcal{V}} \exp(\boldsymbol{z}_{t,y'} + \boldsymbol{u}_{t,l(y')})} $。
  • 采用加权求和机制,将 wav2vec 2.0 多个层的表征进行融合,其中 CTC 与 LID 模块的权重可学习。
  • 在预训练后联合微调 CTC 与 LID 模块,以改善对齐并提升性能,避免端到端联合训练带来的不稳定性。
  • 比较不同训练策略:CTC 与 LID 分别训练、端到端联合训练,以及预训练模型的微调。

实验结果

研究问题

  • RQ1在仅使用单语英文数据预训练的自监督语音表征模型中,是否仍能捕捉到代码切换语音的帧级语言身份?
  • RQ2使用 SSL 特征联合训练 CTC 与 LID 模块,相较于独立的 CTC 模型,如何提升代码切换语音识别性能?
  • RQ3多语言预训练对代码切换语音识别系统性能有何影响?
  • RQ4CTC 与 LID 预测之间的对齐是否影响解码准确率,特别是在模糊或频繁切换的区域?
  • RQ5预训练的 wav2vec 2.0 模型中哪些层对 CTC 与 LID 任务贡献最大?它们是否表现出相似的表征模式?

主要发现

  • 在仅使用英文数据预训练的 wav2vec 2.0 自监督语音表征中,仍包含帧级语言身份信息,无需额外微调即可实现有效的语言识别。
  • 利用预训练 SSL 特征联合训练 CTC 与 LID 模块可显著提升代码切换语音识别性能,尤其在两者共同微调时效果更优。
  • 在多语言数据上进行预训练可获得最佳的代码切换语音识别性能,优于单语言预训练。
  • 联合微调预训练的 CTC 与 LID 模块可实现更优的模块间对齐,并显著提升解码准确率,优于分别训练或从零开始训练。
  • LID 模块可纠正 CTC 的错误——例如,在一个示例中,单词 "break" 在联合微调模型下被正确解码为英文,而非被误识别为中文字符 "不"。
  • 加权求和机制表明,CTC 与 LID 任务依赖于 wav2vec 2.0 的相似隐藏层,表明两者在代码切换识别中共享对上下文表征的依赖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。