[论文解读] Semi-supervised ASR by End-to-end Self-training
本文提出了一种用于半监督自动语音识别(ASR)的端到端自训练方法,通过迭代方式使用束搜索解码器在未标注数据上生成新鲜的离散token级伪标签,并利用这些伪标签数据对模型进行微调。该方法在WSJ测试集上相对于强大的基线CTC系统实现了14.4%的相对WER降低,使基线系统与全监督最优系统之间的性能差距缩小了46%。
While deep learning based end-to-end automatic speech recognition (ASR) systems have greatly simplified modeling pipelines, they suffer from the data sparsity issue. In this work, we propose a self-training method with an end-to-end system for semi-supervised ASR. Starting from a Connectionist Temporal Classification (CTC) system trained on the supervised data, we iteratively generate pseudo-labels on a mini-batch of unsupervised utterances with the current model, and use the pseudo-labels to augment the supervised data for immediate model update. Our method retains the simplicity of end-to-end ASR systems, and can be seen as performing alternating optimization over a well-defined learning objective. We also perform empirical investigations of our method, regarding the effect of data augmentation, decoding beamsize for pseudo-label generation, and freshness of pseudo-labels. On a commonly used semi-supervised ASR setting with the WSJ corpus, our method gives 14.4% relative WER improvement over a carefully-trained base system with data augmentation, reducing the performance gap between the base system and the oracle system by 50%.
研究动机与目标
- 通过利用大量未标注数据来缓解端到端ASR中的数据稀疏性问题。
- 通过一种简单、迭代的自训练框架提升模型泛化能力与性能,同时保持端到端学习的简洁性。
- 研究伪标签新鲜度、束宽以及数据增强对自训练效果的影响。
- 缩小监督基线系统与在全部标注数据上训练的最优系统之间的性能差距。
提出的方法
- 该方法从一个预训练的CTC模型开始,使用束搜索解码器在未标注语音的迷你批次上迭代生成离散的token级伪标签。
- 随后,将伪标签的(输入,标签)对用于增强监督训练数据,以实现模型的即时微调。
- 该过程在伪标签生成与监督更新之间交替进行,从而在统一的目标函数上执行交替优化。
- 对监督数据和未监督数据均应用数据增强,方法包括速度扰动和频谱掩码。
- 束宽$W$在伪标签生成中进行了调优,较小的$W$在效率与性能表现上均更优。
- 该方法避免使用软后验概率或一次性伪标签生成,而是优先采用实时生成的新鲜硬标签。
实验结果
研究问题
- RQ1在半监督ASR中,迭代式、实时生成的伪标签与一次性或静态伪标签相比表现如何?
- RQ2束搜索解码器中的束宽$W$对伪标签质量与最终模型性能有何影响?
- RQ3同时对监督与未监督数据应用数据增强是否能提升自训练性能?
- RQ4与软目标(如UDA中的)相比,硬伪标签在模型准确率与收敛性方面表现如何?
- RQ5端到端自训练在多大程度上能够缩小基线系统与全监督最优系统之间的性能差距?
主要发现
- 所提出的自训练方法在WSJ测试集上相对于经过良好调优的基线CTC系统(含数据增强)实现了14.4%的相对WER降低。
- 在开发集上,该方法实现了31.6%的相对PER降低,表明泛化能力显著提升。
- 使用束宽$W=1$在性能与训练速度之间实现了最佳平衡,而$W=15$仅带来微小增益但代价显著增加。
- 一次性伪标签生成($W=20$)的表现劣于迭代自训练($W=1$),表明新鲜标签比陈旧标签更有效。
- 硬伪标签优于UDA中的软目标,后者在开发集上达到14.56%的PER,而本方法仅为11.51%。
- 该方法使基线系统(11.43% WER)与最优系统(7.87% WER)之间的性能差距缩小了46%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。