Skip to main content
QUICK REVIEW

[论文解读] Active and Semi-Supervised Learning in ASR: Benefits on the Acoustic and Language Models

Thomas Drugman, Janne Pylkkönen|arXiv (Cornell University)|Mar 7, 2019
Speech Recognition and Synthesis被引用 6
一句话总结

本文提出了一种基于置信度的主动学习(AL)与半监督训练(SST)框架,用于端到端自动语音识别(ASR),表明联合应用AL与SST可将转录成本降低约70%,同时相对提升词错误率(WER)12.5%。该方法利用初始ASR模型生成的低置信度假设来优先选择标注数据,并重用高置信度的自动转录文本进行无监督训练,在声学模型与语言模型性能方面均取得显著提升。

ABSTRACT

The goal of this paper is to simulate the benefits of jointly applying active learning (AL) and semi-supervised training (SST) in a new speech recognition application. Our data selection approach relies on confidence filtering, and its impact on both the acoustic and language models (AM and LM) is studied. While AL is known to be beneficial to AM training, we show that it also carries out substantial improvements to the LM when combined with SST. Sophisticated confidence models, on the other hand, did not prove to yield any data selection gain. Our results indicate that, while SST is crucial at the beginning of the labeling process, its gains degrade rapidly as AL is set in place. The final simulation reports that AL allows a transcription cost reduction of about 70% over random selection. Alternatively, for a fixed transcription budget, the proposed approach improves the word error rate by about 12.5% relative.

研究动机与目标

  • 模拟在高基线性能(WER ~12.5%)的真实ASR应用中,结合主动学习(AL)与半监督训练(SST)的收益。
  • 评估AL是否不仅对声学模型(AM)训练有益,也对语言模型(LM)训练有益,并量化其增益。
  • 研究当通过AL收集更多有监督数据时,SST的可扩展性与收益递减特性。
  • 评估更复杂的置信度模型是否相比简单置信度过滤能提升数据选择性能。
  • 确定在交叉熵与序列判别性训练中,整合无监督数据的最佳策略。

提出的方法

  • 数据选择基于初始ASR模型生成的自动转录文本的置信度过滤,通过分段多项式或线性回归将词元后验映射为校准的置信度分数。
  • 主动学习选择置信度最低的语音片段进行人工标注,而无监督数据则由置信度较高的转录文本构成,用于联合训练。
  • 声学模型采用交叉熵(XE)和序列判别性回译最大似然比(bMMI)准则进行训练,SST应用于200小时的无监督数据。
  • 语言模型使用通过AL或随机选择筛选出的有监督数据重新训练,并更新词汇表以匹配所选数据。
  • 半监督训练采用置信度过滤,并增加对转录文本长度与频率的额外约束,以提升数据质量。
  • 最终模拟评估在AM与LM上联合应用AL与SST的效果,对比随机选择策略下的WER提升与转录成本节省。

实验结果

研究问题

  • RQ1更复杂的置信度模型是否能提升ASR主动学习中的数据选择性能?
  • RQ2主动学习是否对语言模型训练有益,程度如何?
  • RQ3当通过主动学习收集更多有监督数据时,半监督训练的增益如何变化?
  • RQ4AL与SST的改进效果在不同声学模型训练准则(如交叉熵与序列判别性训练)下是否一致?
  • RQ5在AM与LM上联合应用AL与SST时,对转录成本与WER的总体影响是什么?

主要发现

  • 与随机选择相比,主动学习将转录成本降低了约70%,仅使用30%的标注数据即可达到相同的WER。
  • 在100小时的固定转录预算下,AL相比随机选择使WER相对降低12.5%。
  • 在100小时标注数据后,AL与SST联合使用使语言模型的WER相对降低5.3%,相当于随机选择400小时的数据量。
  • 半监督训练在标注过程初期带来显著增益,但一旦应用主动学习,其收益迅速下降,尤其在100小时后更为明显。
  • 尽管置信度阈值较高(0.7),无监督数据在序列判别性bMMI训练中仍使性能下降约2.5%,表明噪声转录文本会损害判别性模型。
  • 当50小时AL数据与200小时无监督数据结合时,AL与SST联合使用使声学模型的WER相对降低4.5%,证明了联合优化的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。