Skip to main content
QUICK REVIEW

[论文解读] Very Deep Multilingual Convolutional Neural Networks for LVCSR

Tom Sercu, Christian Puhrsch|arXiv (Cornell University)|Sep 29, 2015
Speech Recognition and Synthesis参考文献 27被引用 6
一句话总结

本文提出一种非常深的多语言卷积神经网络(CNN),用于大规模词汇量连续语音识别(LVCSR),采用受VGG启发的架构,包含14层权重参数、小尺寸3×3卷积核,以及每个池化层前的多层卷积。在Hub5'00数据集上,该方法实现了1.4%的绝对词错误率(WER)降低(相对降低10.6%),WER降至11.8%;在低资源Babel任务上,通过联合训练六种语言,WER提升了5.77%。

ABSTRACT

Convolutional neural networks (CNNs) are a standard component of many current state-of-the-art Large Vocabulary Continuous Speech Recognition (LVCSR) systems. However, CNNs in LVCSR have not kept pace with recent advances in other domains where deeper neural networks provide superior performance. In this paper we propose a number of architectural advances in CNNs for LVCSR. First, we introduce a very deep convolutional network architecture with up to 14 weight layers. There are multiple convolutional layers before each pooling layer, with small 3x3 kernels, inspired by the VGG Imagenet 2014 architecture. Then, we introduce multilingual CNNs with multiple untied layers. Finally, we introduce multi-scale input features aimed at exploiting more context at negligible computational cost. We evaluate the improvements first on a Babel task for low resource speech recognition, obtaining an absolute 5.77% WER improvement over the baseline PLP DNN by training our CNN on the combined data of six different languages. We then evaluate the very deep CNNs on the Hub5'00 benchmark (using the 262 hours of SWB-1 training data) achieving a word error rate of 11.8% after cross-entropy training, a 1.4% WER improvement (10.6% relative) over the best published CNN result so far.

研究动机与目标

  • 将受ImageNet 2014年VGG模型启发的非常深的CNN架构应用于大规模词汇量连续语音识别(LVCSR),其中更深的网络尚未被广泛采用。
  • 通过在六种语言的联合数据上训练多语言CNN,提升低资源语音识别性能,利用语言间的共享声学表征。
  • 通过多尺度输入特征增强上下文建模能力,以极低的计算成本获取更丰富的声学上下文信息。
  • 在标准基准测试(如Hub5'00和Babel低资源任务)上评估所提出的深度CNN架构,验证其在性能上优于先前基于CNN和DNN的系统。

提出的方法

  • 采用VGG风格架构,使用堆叠的3×3卷积核块,在池化层前堆叠多层卷积,将网络深度增至14层权重参数(10层卷积,4层全连接),以小卷积核和ReLU非线性激活替代大卷积核和Sigmoid激活。
  • 引入具有参数未绑定(untied)结构的多语言CNN,允许各语言进行特定的特征学习,同时共享深层表征,从而在低资源设置下提升泛化能力。
  • 通过组合不同时间分辨率的输入语谱图,实现多尺度输入特征,使网络能够高效捕捉局部与更广范围的上下文信息。
  • 使用自适应优化算法(Adadelta和Adam)训练深层网络,采用两阶段策略:先用自适应方法进行预训练,再通过SGD微调,以提升收敛速度与最终性能。
  • 在Hub5'00实验中应用说话人相关的VTLN和delta/double-delta特征,并使用数据平衡因子γ=0.8以缓解训练中的类别不平衡问题。
  • 采用交叉熵损失函数进行模型训练,并在标准基准上进行评估:Hub5'00 SWB和Babel低资源任务,与经典CNN和DNN基线方法进行对比。

实验结果

研究问题

  • RQ1与浅层经典CNN相比,采用小尺寸3×3卷积核和每个池化层前多层卷积的非常深CNN架构,是否能在LVCSR中提升性能?
  • RQ2在低资源语音识别任务中,采用未绑定参数的多语言训练方法在性能提升方面有多高效?
  • RQ3多尺度输入特征是否能在计算开销可忽略的前提下,增强LVCSR中的声学建模能力?
  • RQ4使用自适应优化方法(Adadelta/Adam)训练深层CNN,再通过SGD微调,其性能相比标准训练策略在LVCSR中有多显著优势?
  • RQ5与先前的SOTA CNN和DNN系统相比,所提出的深度多语言CNN在Hub5'00等标准基准和低资源Babel任务上的性能增益如何?

主要发现

  • 所提出的14层权重参数的非常深CNN在Hub5'00 SWB基准上,经交叉熵训练后达到11.8%的词错误率(WER),相比当时已发表的最佳CNN结果,绝对WER降低1.4%(相对降低10.6%)。
  • 在Babel低资源任务上,通过六种语言的联合训练,多语言CNN使WER相比基线PLP DNN降低了5.77%绝对值,显著提升了低资源环境下的性能。
  • 使用Adadelta预训练后进行SGD微调的模型,在仅经过1.5轮遍历9210万帧的Hub5'00训练数据集(共1.4亿帧)后,WER达到12.2%,表明优化策略得当可实现快速收敛。
  • 仅使用SGD从头训练的模型达到最佳性能11.8% WER,但需要3.5轮数据遍历,表明尽管训练时间更长,全SGD训练仍能获得更优结果。
  • 多尺度特征的使用在计算开销几乎不变的前提下,提升了上下文建模能力,对低资源和标准基准的性能提升均有贡献。
  • 结果表明,受ImageNet成功启发的更深CNN架构在LVCSR中极为有效,且可通过多语言预训练和多尺度输入处理进一步增强性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。