[论文解读] XLST: Cross-lingual Self-training to Learn Multilingual Representation for Low Resource Speech Recognition
本文提出 XLST,一种跨语言自训练框架,通过利用少量高资源语言(如英语)的标注数据和大规模未标注多语言数据,提升了多语言语音表征学习效果。通过采用带有移动平均目标网络的教师-学生设置以及多视角数据增强,XLST 在五个低资源语音识别任务上相较最先进自监督方法实现了 18.6% 的相对 WER 降低,即使模型规模更小也取得了显著提升。
In this paper, we propose a weakly supervised multilingual representation learning framework, called cross-lingual self-training (XLST). XLST is able to utilize a small amount of annotated data from high-resource languages to improve the representation learning on multilingual un-annotated data. Specifically, XLST uses a supervised trained model to produce initial representations and another model to learn from them, by maximizing the similarity between output embeddings of these two models. Furthermore, the moving average mechanism and multi-view data augmentation are employed, which are experimentally shown to be crucial to XLST. Comprehensive experiments have been conducted on the CommonVoice corpus to evaluate the effectiveness of XLST. Results on 5 downstream low-resource ASR tasks shows that our multilingual pretrained model achieves relatively 18.6% PER reduction over the state-of-the-art self-supervised method, with leveraging additional 100 hours of annotated English data.
研究动机与目标
- 解决大多数语言标注数据稀缺所带来的低资源语音识别挑战。
- 通过利用高资源语言的少量标注数据,改进多语言表征学习。
- 开发一种弱监督预训练框架,实现在无需平行数据的情况下跨语言知识迁移。
- 探究移动平均和多视角数据增强在跨语言表征学习中的有效性。
提出的方法
- XLST 采用双网络结构:学生模型和目标网络(教师),后者从同一输入的不同增强视图中生成帧级嵌入。
- 损失函数定义为学生输出与目标网络输出之间的不相似性,促使学生从经过优化、在线更新的目标中学习。
- 移动平均机制通过学生参数的加权平均更新目标网络参数,稳定训练过程并提升性能。
- 通过时域跨度掩码和频域掩码实施多视角数据增强,以提升鲁棒性和上下文建模能力。
- 框架采用对比损失形式端到端训练,最大化同一样本不同增强视图之间的对齐。
- 该方法应用于多语言设置中,教师模型从高资源语言(如英语)初始化,学生模型则从多种低资源语言的未标注数据中学习。
实验结果
研究问题
- RQ1少量高资源语言的标注数据是否能改善低资源语言的多语言表征学习?
- RQ2跨语言自训练相较于自监督预训练在多语言语音识别中的表现如何?
- RQ3移动平均和多视角数据增强对 XLST 性能的影响是什么?
- RQ4XLST 在低资源语音识别任务上是否比单语言或多语言自监督预训练具有更好的泛化能力?
主要发现
- XLST 在五个低资源语音识别任务上相较最先进自监督方法 XLSR-10 实现了 18.6% 的相对词错误率(WER)降低,仅使用了额外 100 小时的英语标注数据。
- 多语言预训练模型(XLST-Multi)相较最佳英语单语言预训练模型(ST-en1250)实现了 34.7% 的相对 WER 降低。
- 移动平均机制在跨语言设置中显著提升性能,尤其在语言不匹配导致初始目标质量较差时效果明显,但在单语言预训练中无明显优势。
- 时域跨度掩码是最有效的数据增强策略,相比无增强,平均下游 WER 降低 6.8%。
- XLST-mono(单语言预训练)优于 XLSR-单语言模型,并在低资源语言上表现优于 Unispeech+,尽管其使用数据更少且模型更小。
- 消融实验表明,移动平均和多视角增强均至关重要,二者结合在所有五个低资源语言上均取得最佳效果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。