Skip to main content
QUICK REVIEW

[论文解读] Acoustic data-driven lexicon learning based on a greedy pronunciation selection framework

Xiaohui Zhang, Vimal Manohar|arXiv (Cornell University)|Jun 12, 2017
Speech Recognition and Synthesis参考文献 16被引用 5
一句话总结

本文提出一种基于似然的贪心发音候选修剪框架,通过结合字符到音素(G2P)和语音解码输出,从语音数据中学习紧凑且高性能的词典。通过迭代移除对语音似然影响最小的候选发音,该方法在词错误率(WER)上接近专家词典性能,优于仅使用G2P或基于概率的修剪方法,同时将每个词的平均发音数从约5个减少至1.42个。

ABSTRACT

Speech recognition systems for irregularly-spelled languages like English normally require hand-written pronunciations. In this paper, we describe a system for automatically obtaining pronunciations of words for which pronunciations are not available, but for which transcribed data exists. Our method integrates information from the letter sequence and from the acoustic evidence. The novel aspect of the problem that we address is the problem of how to prune entries from such a lexicon (since, empirically, lexicons with too many entries do not tend to be good for ASR performance). Experiments on various ASR tasks show that, with the proposed framework, starting with an initial lexicon of several thousand words, we are able to learn a lexicon which performs close to a full expert lexicon in terms of WER performance on test data, and is better than lexicons built using G2P alone or with a pruning criterion based on pronunciation probability.

研究动机与目标

  • 为解决在低资源语音识别中,针对未登录词(OOV)构建准确且紧凑的发音词典的挑战。
  • 克服G2P模型和基于概率的修剪方法的局限性,后者常保留过多、微小的发音变体。
  • 开发一种数据驱动方法,利用语音证据与发音多样性,选择最优候选发音。
  • 在不牺牲ASR性能的前提下减少词典规模,尤其在低资源设置下。
  • 证明基于似然的修剪方法在WER上优于基于概率或仅使用G2P的方法。

提出的方法

  • 使用在小规模专家词典上训练的G2P模型,以及从对齐训练数据中获得的语音解码,生成发音候选。
  • 通过合并每个OOV词的G2P和语音解码候选,构建联合词典。
  • 通过计算从声学模型获得的格网中条件似然τ_uwb = p(O_u|w,b),收集语音证据。
  • 应用一种贪心的、基于似然下降的修剪准则:迭代移除使总似然∑_u τ_uwb下降最小的候选b。
  • 在ASR解码中使用所得的紧凑词典,并通过迭代优化直至收敛。
  • 在所有词典条件下,使用相同训练方案(SAT和LF-MMI)训练声学模型,以确保公平比较。
Figure 1: The proposed framework of acoustic-data driven lexicon learning.
Figure 1: The proposed framework of acoustic-data driven lexicon learning.

实验结果

研究问题

  • RQ1基于似然的修剪准则是否能在OOV词的发音候选选择中优于基于概率的修剪?
  • RQ2结合G2P与语音解码候选是否能提升词典质量,优于仅使用G2P?
  • RQ3能否通过一个紧凑词典(平均每个词1.42个发音)实现接近完整专家词典的WER性能?
  • RQ4与G2P扩展和基于概率的修剪基线相比,所提方法在WER和词典规模方面表现如何?
  • RQ5该框架在训练数据有限和种子词典较小时是否具有良好的可扩展性?

主要发现

  • 所提出的基于似然下降的修剪方法将每个词的平均发音数从5.43减少至1.59,显著提升了紧凑性。
  • 在Librispeech-460任务中,所学词典在SAT解码下达到12.06%的WER,优于G2P扩展基线(13.72%)和基于概率的修剪基线(12.24%)。
  • 在SAT解码下,该框架缩小了88%的WER差距,使G2P扩展系统与理想专家词典之间的差距。
  • 在LF-MMI解码下,该框架缩小了36%的WER差距,表明其对不同声学模型训练准则具有鲁棒性。
  • 与仅使用G2P的方案相比,将语音解码候选加入候选池使WER提升了0.82%,凸显了多样化候选来源的重要性。
  • 与G2P-1best基线(每个词仅1个发音)相比,所学词典实现了20.9%的相对WER改进,证明紧凑性并不意味着性能损失。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。