[论文解读] Momentum Pseudo-Labeling for Semi-Supervised Speech Recognition
该论文提出了一种名为动量伪标签(Momentum Pseudo-Labeling, MPL)的简单而高效的端到端自动语音识别(ASR)半监督学习方法。MPL 通过使用在线模型和具有动量平均权重的离线模型,在训练过程中迭代地优化伪标签,无需使用束搜索或语言模型,即可在多样化的数据和领域不匹配场景下实现最先进性能。
Pseudo-labeling (PL) has been shown to be effective in semi-supervised automatic speech recognition (ASR), where a base model is self-trained with pseudo-labels generated from unlabeled data. While PL can be further improved by iteratively updating pseudo-labels as the model evolves, most of the previous approaches involve inefficient retraining of the model or intricate control of the label update. We present momentum pseudo-labeling (MPL), a simple yet effective strategy for semi-supervised ASR. MPL consists of a pair of online and offline models that interact and learn from each other, inspired by the mean teacher method. The online model is trained to predict pseudo-labels generated on the fly by the offline model. The offline model maintains a momentum-based moving average of the online model. MPL is performed in a single training process and the interaction between the two models effectively helps them reinforce each other to improve the ASR performance. We apply MPL to an end-to-end ASR model based on the connectionist temporal classification. The experimental results demonstrate that MPL effectively improves over the base model and is scalable to different semi-supervised scenarios with varying amounts of data or domain mismatch.
研究动机与目标
- 解决端到端自动语音识别(ASR)中因标注数据有限而带来的高标注成本问题。
- 克服现有迭代伪标签方法(IPL)在数据稀缺或领域不匹配情况下的不稳定性与低效性。
- 开发一种可扩展的单阶段训练框架,避免使用启发式标签更新控制机制,并减少对外部语言模型或束搜索的依赖。
- 通过基于动量的权重平均实现模型集成,提升半监督 ASR 中的泛化能力与鲁棒性。
- 实现在不同数据量和领域偏移下对未标注数据的有效自训练,增强实际应用场景的适用性。
提出的方法
- 提出一种双模型框架,包含一个在线模型和一个离线模型,其中离线模型对在线模型的权重进行动量加权移动平均。
- 利用离线模型实时生成未标注数据的伪标签,该模型在训练期间充当教师模型。
- 使用标注数据和来自离线模型的动态更新伪标签联合训练在线模型。
- 通过指数平均方式更新离线模型的权重:$\phi \leftarrow \alpha \phi + (1 - \alpha)\xi$,其中 $\alpha$ 为动量系数。
- 通过数据相关的权重 $w$ 控制动量更新,以平衡基础模型的保留与适应速度,减少对人工超参数调优的需求。
- 在单一训练循环内应用该方法,实现稳定且高效的自训练,无需重新训练或复杂的学习率调度。
![Table 2: WER [ $\%$ ] and WRR [ $\%{\uparrow}$ ] on out-domain TEDLIUM3 (TED3) setting.](https://ar5iv.labs.arxiv.org/html/2106.08922/assets/fig/ls360.png)
实验结果
研究问题
- RQ1与标准或迭代方法相比,基于动量的双模型框架是否能提升半监督 ASR 中伪标签的稳定性和有效性?
- RQ2在未标注数据量变化以及标注与未标注数据之间存在领域差异的情况下,MPL 的表现如何?
- RQ3MPL 在多大程度上减少了对用于生成伪标签的外部语言模型或束搜索的依赖?
- RQ4动量更新权重 $w$ 对模型收敛与性能的影响如何?是否可在无需大量超参数搜索的情况下实现有效调优?
- RQ5在最终 ASR 准确率和训练效率方面,MPL 是否优于迭代伪标签(IPL)方法?
主要发现
- 在 LS-100/LS-360 设置下,MPL 在 LibriSpeech test-clean 上达到 9.6% 的 WER,在 test-other 上为 22.6%,优于迭代伪标签(PL4:9.9% / 24.2%)和标准 PL(24.4% / 39.2%)。
- 在 LS-100/LS-860 设置下,MPL 将 WER 降低至 9.2%(test-clean)和 18.1%(test-other),优于 PL4(9.4% / 20.7%),并展现出对更大规模未标注数据的可扩展性。
- 在领域不匹配设置(LS-100/TED3)下,MPL 在 TED3 测试集上达到 17.6% 的 WER,显著优于 PL4(21.3%),表现出对分布偏移的鲁棒性。
- 提出的动量调优策略($w=0.5$)有效控制了模型适应过程,避免了低 $w$ 值下的不稳定性与高 $w$ 值下的性能下降,且几乎无需人工调参。
- 在未使用 SpecAugment 的情况下,MPL 的性能下降至 39.7% / 48.1% 的 WER,表明数据增强对 MPL 的有效性与泛化能力至关重要。
- 经过检查点平均后的在线模型性能几乎与离线模型完全一致,验证了训练过程的稳定性和一致性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。