[论文解读] Boosting Active Learning for Speech Recognition with Noisy Pseudo-labeled Samples
该论文提出了一种训练流程,通过在未标注数据的噪声伪标签样本上应用一致性正则化,提升了端到端自动语音识别中的主动学习效果。通过应用精心设计的音频增强技术,确保模型在扰动输入下保持一致性,该方法在标注预算仅为1/3的情况下,将CER降低了最多12.76%,显著优于无需额外标注工作量的标准主动学习方法。
The cost of annotating transcriptions for large speech corpora becomes a bottleneck to maximally enjoy the potential capacity of deep neural network-based automatic speech recognition models. In this paper, we present a new training pipeline boosting the conventional active learning approach targeting label-efficient learning to resolve the mentioned problem. Existing active learning methods only focus on selecting a set of informative samples under a labeling budget. One step further, we suggest that the training efficiency can be further improved by utilizing the unlabeled samples, exceeding the labeling budget, by introducing sophisticatedly configured unsupervised loss complementing supervised loss effectively. We propose new unsupervised loss based on consistency regularization, and we configure appropriate augmentation techniques for utterances to adopt consistency regularization in the automatic speech recognition task. From the qualitative and quantitative experiments on the real-world dataset and under real-usage scenarios, we show that the proposed training pipeline can boost the efficacy of active learning approaches, thus successfully reducing a sustainable amount of human labeling cost.
研究动机与目标
- 为降低大规模语音识别数据集中高昂的人工标注成本,从而提升端到端ASR模型的可扩展性。
- 通过利用超出标注预算的未标注样本,提升主动学习中的标签效率。
- 通过稳健的正则化方法缓解半监督学习中噪声伪标签导致的性能下降问题。
- 通过设计保留语言内容同时支持模型鲁棒性的音频增强技术,实现在ASR中的一致性正则化。
- 在实际低预算设置下,于真实世界异构领域语音数据上验证所提出流程的有效性。
提出的方法
- 提出一种混合训练流程,结合主动学习(HLS)与利用未标注数据生成的伪标签样本(PLS)的半监督学习。
- 应用一致性正则化(CR),强制模型对同一语音的原始版本与增强版本输出一致的预测结果。
- 设计领域特定的音频增强技术(如速度扰动、噪声注入),在保留语音内容的同时支持ASR中的一致性正则化。
- 采用两阶段流程:首先,为高置信度的未标注样本生成伪标签;其次,应用CR损失对原始输入和增强输入的预测结果进行正则化。
- 通过在固定间隔周期性地进行伪标签生成(使用束搜索解码),在保持模型新鲜度的同时降低计算成本。
- 在异构领域场景中引入初步过滤步骤(阈值τ = -0.5),以排除低置信度的伪标签。
实验结果
研究问题
- RQ1一致性正则化能否有效缓解端到端自动语音识别中由噪声伪标签引起的性能下降?
- RQ2在ASR中进行一致性正则化时,哪些类型的音频增强技术可在不破坏语言内容的前提下适用?
- RQ3在受限标注预算下,与标准主动学习相比,所提出流程在标签效率方面有何提升?
- RQ4当初始数据与未标注数据来自不同领域时,未标注数据中的伪标签样本能在多大程度上提升模型性能?
- RQ5伪标签生成的最优频率是多少,才能在训练效率与模型性能之间取得平衡?
主要发现
- 当标注预算为未标注数据总量的1/3时,所提出的+CR-SA流程相比标准主动学习,将字符错误率(CER)降低了12.76%。
- 在1/10的标注预算下,该方法相比传统主动学习实现了4.02%的CER改进。
- 仅使用137小时标注数据(386小时总量的1/3),模型性能与全批量训练模型仅相差0.82个百分点,展现出极强的标签效率。
- 一致性正则化显著降低了伪标签的错误率(P-CER);+CR-Xs在训练过程中表现出稳定且持续改善的P-CER,而无正则化的基线模型则无此趋势。
- 在1、3或5个周期的间隔下进行周期性伪标签生成,性能仅下降0.2个百分点,实现了对大规模未标注数据集的高效训练。
- 在异构领域设置下(如AI助手 vs. 地图导航),+CR-SA-τ流程仅使用少量标注数据,即可将模型性能恢复至接近全批量训练的水平。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。