Skip to main content
QUICK REVIEW

[论文解读] Densely Connected Convolutional Networks for Speech Recognition

Chia Yu Li, Ngoc Thang Vu|arXiv (Cornell University)|Aug 10, 2018
Speech Recognition and Synthesis参考文献 14被引用 6
一句话总结

本文提出DenseNet用于自动语音识别中的声学建模,通过密集连接和特征重用构建紧凑且深层的网络。在Wall Street Journal和Resource Management数据集上达到最先进性能,优于DNN、CNN和VGG,甚至仅使用一半训练数据时仍表现更优,证明其在数据效率和训练效率方面具有显著优势,得益于瓶颈结构与压缩组件。

ABSTRACT

This paper presents our latest investigation on Densely Connected Convolutional Networks (DenseNets) for acoustic modelling (AM) in automatic speech recognition. DenseN-ets are very deep, compact convolutional neural networks, which have demonstrated incredible improvements over the state-of-the-art results on several data sets in computer vision. Our experimental results show that DenseNet can be used for AM significantly outperforming other neural-based models such as DNNs, CNNs, VGGs. Furthermore, results on Wall Street Journal revealed that with only a half of the training data DenseNet was able to outperform other models trained with the full data set by a large margin.

研究动机与目标

  • 研究密集连接卷积网络(DenseNets)在自动语音识别(ASR)声学建模中的有效性。
  • 评估DenseNets在有限训练数据和较低计算成本下是否能实现高性能。
  • 分析深度、瓶颈层和压缩等架构组件对ASR性能和训练效率的影响。
  • 在标准ASR基准(WSJ和RM)上,对比DenseNet与DNN、CNN和VGG等标准模型的性能。

提出的方法

  • DenseNet通过从每一层到所有后续层的直接跳跃连接,使每一层的输入为所有先前特征图的拼接。
  • 每层的复合函数由批量归一化、ReLU激活和3×3卷积层组成。
  • 密集块由具有密集连接的层组成,过渡层则使用1×1卷积和2×2平均池化来减小特征图尺寸并压缩通道数。
  • 网络采用瓶颈结构(在3×3卷积前使用1×1卷积)和压缩(通过超参数θ)以减少参数量并加快训练速度。
  • 模型使用未经调整的40维对数Mel滤波器组特征进行训练,并针对dev’93集的词错误率(WER)进行优化。
  • 系统性地调整深度、密集块数量和压缩率(θ)等超参数,以优化性能和训练时间。

实验结果

研究问题

  • RQ1与标准模型相比,DenseNet是否能在显著减少训练数据的情况下实现ASR的最先进性能?
  • RQ2深度、瓶颈层和压缩等架构组件如何影响训练速度和识别准确率?
  • RQ3DenseNet的紧凑特性是否能实现声学建模中的优越数据效率?
  • RQ4在WSJ和RM数据集上,DenseNet与DNN、CNN和VGG相比,在WER和训练时间方面表现如何?

主要发现

  • DenseNet-C在深度61、压缩率θ=0.4时,在3小时RM数据集上达到最优WER 1.91,优于其他DenseNet变体和标准模型。
  • 在Wall Street Journal数据集上,仅使用36小时数据(全集78小时的一半)训练的DenseNet-C在dev’93上达到WER 7.52,接近全量数据训练模型的最优结果7.12。
  • DenseNet-C在4个密集块、深度61时,RM数据集上的WER为2.10,相比3个密集块显著缩短了训练时间,归因于更高的压缩率和更少的参数。
  • 在RM和WSJ数据集上,深度61且θ=0.4的模型均取得最佳性能,表明深度和压缩对最优结果至关重要。
  • DenseNet-C在RM和WSJ数据集上均显著优于DNN、CNN和VGG,即使后者在完整WSJ数据集上训练。
  • 当密集块数量从3增加到4时,训练时间减少25%(12 vs 16个周期),归因于参数更少且压缩更频繁。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。