Skip to main content
QUICK REVIEW

[论文解读] Learning Speech Rate in Speech Recognition

Xiangyu Zeng, Shi Yin|arXiv (Cornell University)|Jun 2, 2015
Speech Recognition and Synthesis参考文献 11被引用 3
一句话总结

本文提出一种基于深度神经网络(DNN)的方法,通过将语音速率(ROS)作为输入特征,以补偿自动语音识别中因语音速率异常导致的谱失真。该方法在不损害正常速率识别性能的前提下,一致提升了慢速和快速语音的识别性能;当与HMM转移概率自适应结合时,进一步提升了性能,证实语音速率变化会影响语音信号的时序与谱特性。

ABSTRACT

A significant performance reduction is often observed in speech recognition when the rate of speech (ROS) is too low or too high. Most of present approaches to addressing the ROS variation focus on the change of speech signals in dynamic properties caused by ROS, and accordingly modify the dynamic model, e.g., the transition probabilities of the hidden Markov model (HMM). However, an abnormal ROS changes not only the dynamic but also the static property of speech signals, and thus can not be compensated for purely by modifying the dynamic model. This paper proposes an ROS learning approach based on deep neural networks (DNN), which involves an ROS feature as the input of the DNN model and so the spectrum distortion caused by ROS can be learned and compensated for. The experimental results show that this approach can deliver better performance for too slow and too fast utterances, demonstrating our conjecture that ROS impacts both the dynamic and the static property of speech. In addition, the proposed approach can be combined with the conventional HMM transition adaptation method, offering additional performance gains.

研究动机与目标

  • 解决因语音速率异常偏低或偏高导致的语音识别性能下降问题。
  • 探究语音速率变化是否不仅影响语音信号的时序(动态)特性,也影响其谱特性(静态)。
  • 开发一种基于DNN的补偿方法,以学习并校正由语音速率变化引起的谱失真。
  • 证明将基于DNN的谱补偿与传统的HMM转移概率自适应结合,可实现互补的性能提升。

提出的方法

  • 将语音速率(ROS)作为DNN声学模型的附加输入特征,使网络能够学习与ROS相关的模式。
  • 使用ROS值作为输入,以监督方式训练DNN模型,使其学习并补偿极端语音速率引起的谱失真。
  • 采用连续的ROS值作为输入,而非离散类别(如“慢速/快速”),以实现跨速率的平滑参数共享,提升数据利用效率。
  • 在标准DNN声学建模范式中实现基于DNN的ROS补偿,无需修改HMM转移结构。
  • 将基于DNN的补偿方法与传统的HMM转移概率自适应(如调整自转移概率)结合,以同时应对谱失真和时序失真。
  • 在极端ROS测试集(慢速:<6音素/秒,快速:>6音素/秒)上评估该方法,并与GMM和DNN基线模型进行对比。

实验结果

研究问题

  • RQ1语音速率变化是否不仅影响音素单位的时长,也影响语音信号的谱特性?
  • RQ2基于DNN的声学模型能否有效学习并补偿由异常语音速率引起的谱失真?
  • RQ3基于DNN的ROS补偿带来的性能提升是否独立于HMM转移概率自适应,还是二者具有互补性?
  • RQ4将连续ROS作为输入特征是否比对语音速率进行离散分类能带来更好的泛化能力?
  • RQ5所提方法能否在不损害正常速率语音识别性能的前提下,同时提升慢速和快速语音的识别准确率?

主要发现

  • 基于DNN的ROS补偿方法显著提升了慢速和快速语音的识别性能:在极慢速语音(<4音素/秒)上,WER从45.71%降至44.92%;在极快速语音(>10音素/秒)上,WER从31.22%降至29.54%。
  • 基于HMM的转移概率自适应方法在快速语音上提升了性能(WER从31.22%降至30.13%),但在慢速语音上未见改善,表明慢速语音性能下降并非仅由时序失真引起。
  • 将基于DNN的谱补偿与基于HMM的时序自适应结合,可进一步提升性能,快速语音的WER降至29.08%,证实ROS变化同时引起谱失真和时序失真。
  • 仅使用慢速或快速语音进行训练,会在不匹配的测试集上导致显著性能下降,凸显训练数据中多样化ROS的重要性。
  • 基于DNN的方法在所有ROS条件下均提升了性能,且未损害正常速率语音的识别效果,证明其鲁棒性与泛化能力。
  • 结果证实,ROS同时影响语音信号的动态(时序)与静态(谱)特性,且仅靠HMM自适应无法完全校正谱失真。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。