Skip to main content
QUICK REVIEW

[论文解读] Advances in All-Neural Speech Recognition

Geoffrey Zweig, Chengzhu Yu|arXiv (Cornell University)|Sep 19, 2016
Speech Recognition and Synthesis参考文献 21被引用 7
一句话总结

该论文通过引入一种利用词首大写字母的新型符号集合,以及一种两阶段迭代CTC框架,推进了全神经语音识别的发展。该框架通过第二个RNN对噪声较大的字母输出进行优化。该方法在CallHome数据集上实现了14.0%的SOTA词错误率(WER),在Switchboard数据集上实现了25.3%的WER,且无需外部语言模型,显著优于以往仅使用300小时Switchboard数据的端到端系统。

ABSTRACT

This paper advances the design of CTC-based all-neural (or end-to-end) speech recognizers. We propose a novel symbol inventory, and a novel iterated-CTC method in which a second system is used to transform a noisy initial output into a cleaner version. We present a number of stabilization and initialization methods we have found useful in training these networks. We evaluate our system on the commonly used NIST 2000 conversational telephony test set, and significantly exceed the previously published performance of similar systems, both with and without the use of an external language model and decoding technology.

研究动机与目标

  • 通过消除对外部语言模型和解码组件的依赖,提升端到端语音识别性能。
  • 探究神经网络是否能够独立建模束搜索解码器与语言建模的逻辑。
  • 探索CTC-based全神经系统的符号集合设计与训练稳定性技术。
  • 评估两阶段CTC过程在优化原始神经网络输出方面的有效性。

提出的方法

  • 使用ReLU-RNN与双向架构,在CTC框架下训练,将声学特征直接映射到音素输出。
  • 提出一种新型符号集合:使用大写字母表示词首字符,而非使用空格,从而提升识别准确率。
  • 采用迭代CTC方法:第一阶段RNN将音频映射为字母,第二阶段RNN对噪声较大的字母序列进行优化,生成更清晰的输出。
  • 应用训练稳定化与初始化技术,包括权重归一化与细致的学习率调度,以提升训练稳定性。
  • 使用字符与词n-gram语言模型作为后处理增强手段,并评估其对最终WER的影响。
  • 采用束搜索与CTC解码作为对比基线,但重点在于完全使用神经网络进行后处理,不依赖外部语言模型。

实验结果

研究问题

  • RQ1两阶段CTC系统是否能在全神经语音识别中超越单阶段端到端模型?
  • RQ2使用词首大写字母作为符号编码策略,是否相比使用显式的空白符号能提升性能?
  • RQ3神经网络在不依赖外部语言模型的情况下,能在多大程度上建模束搜索解码器的逻辑?
  • RQ4训练稳定化与初始化技术对基于CTC的RNN收敛性与最终性能有何影响?

主要发现

  • 与使用显式空白符号相比,采用词首大写字母的符号集合在CallHome与Switchboard数据集上分别将WER降低了1.2%。
  • 迭代CTC系统在CallHome上的WER降低至24.7%,在Switchboard上降低至37.1%(无语言模型),分别优于基线1.2%与1.7%。
  • 在引入词级语言模型后,系统在CallHome上达到14.0% WER,在Switchboard上达到25.3% WER,创下全神经语音识别在NIST 2000测试集上的新SOTA记录。
  • 使用ReLU-RNN替代LSTM在保持或提升准确率的同时,显著加快了训练速度,证明了ReLU在此场景下的有效性。
  • 添加字符或词n-gram后处理反而削弱了迭代CTC的增益,表明第二阶段RNN已能捕获语言建模的大部分功能。
  • 9层、宽度为1024的双向ReLU-RNN模型拥有5300万参数,表现出强大性能,验证了更深网络在全神经ASR中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。