Skip to main content
QUICK REVIEW

[论文解读] Speech recognition with quaternion neural networks

Titouan Parcollet, Mirco Ravanelli|arXiv (Cornell University)|Nov 21, 2018
Music and Audio Processing参考文献 23被引用 14
一句话总结

本文提出用于自动语音识别的四元数神经网络(QNNs),利用四元数代数更高效地联合建模内部特征依赖性(例如梅尔倒谱能量及其导数)与帧间时序关系。在TIMIT数据集上的实验表明,QNNs在参数量最多减少3.96倍的情况下,实现了最先进水平的音素错误率。

ABSTRACT

Neural network architectures are at the core of powerful automatic speech recognition systems (ASR). However, while recent researches focus on novel model architectures, the acoustic input features remain almost unchanged. Traditional ASR systems rely on multidimensional acoustic features such as the Mel filter bank energies alongside with the first, and second order derivatives to characterize time-frames that compose the signal sequence. Considering that these components describe three different views of the same element, neural networks have to learn both the internal relations that exist within these features, and external or global dependencies that exist between the time-frames. Quaternion-valued neural networks (QNN), recently received an important interest from researchers to process and learn such relations in multidimensional spaces. Indeed, quaternion numbers and QNNs have shown their efficiency to process multidimensional inputs as entities, to encode internal dependencies, and to solve many tasks with up to four times less learning parameters than real-valued models. We propose to investigate modern quaternion-valued models such as convolutional and recurrent quaternion neural networks in the context of speech recognition with the TIMIT dataset. The experiments show that QNNs always outperform real-valued equivalent models with way less free parameters, leading to a more efficient, compact, and expressive representation of the relevant information.

研究动机与目标

  • 探究四元数值神经网络(QNNs)是否能通过同时捕捉内部与外部依赖关系,更优地建模语音识别中的多维声学特征。
  • 在端到端与HMM基语音识别框架中,评估四元数卷积(QCNN)与循环(QRNN)网络相较于其实值对应模型的性能表现。
  • 确定QNNs是否能在显著减少可训练参数数量的同时,实现更低的音素错误率(PER)。
  • 探索四元数的固有结构通过哈密顿积是否能实现对声学特征更高效且更具泛化能力的表示。

提出的方法

  • 本文采用四元数值卷积神经网络(QCNN)与循环神经网络(QRNN)处理标准TIMIT声学特征(梅尔滤波器组能量、一阶与二阶导数)。
  • 利用四元数代数将每帧的时间点上的三维特征向量编码为单一实体,使网络能够通过哈密顿积学习特征内部的关系。
  • 模型采用标准反向传播算法进行训练,优化方法为RMSProp,激活函数使用ReLU/Tanh,并应用Dropout,实值与四元数网络的超参数均经过调优。
  • 在端到端训练中,直接对比QCNN与CNN在TIMIT上的表现;在混合系统中,QRNN与RNN分别用于预测HMM状态,通过Kaldi的WFST框架进行解码。
  • 直接比较等效实值与四元数模型的参数数量,四元数参数采用先前研究中提出的标准初始化方法。
  • 哈密顿积作为QNN的核心运算,实现了多维特征组之间相互作用的高效计算。

实验结果

研究问题

  • RQ1四元数神经网络是否能比实值网络更有效地建模多维声学特征(如梅尔倒谱能量及其导数)内部的依赖关系?
  • RQ2在CNN与RNN中引入四元数代数是否能提升TIMIT基准上的音素识别准确率?
  • RQ3QNNs相较于实值等效模型,在保持或提升性能的同时,可训练参数数量的减少程度如何?
  • RQ4QNNs中减少的参数数量是否能带来更好的泛化能力并降低过拟合现象?

主要发现

  • QCNN在TIMIT测试集上实现了19.5%的音素错误率(PER),优于实值CNN的20.6%,且参数量显著更少。
  • QRNN在测试集上达到18.5%的PER,优于实值RNN的19.0%,表现出更优的性能与泛化能力。
  • QRNN的参数量为380万,而对应实值RNN为940万,相同隐藏维度下参数量减少2.47倍。
  • 所有实验中最大参数减少幅度达到3.96倍,表明QNNs具有显著的效率优势。
  • 由于参数自由度更低,QRNN在更大隐藏维度下仍表现出更轻微的过拟合现象。
  • 结果证实,四元数网络能够比实值模型更有效地学习特征内部关系与帧间依赖,从而生成更具表现力且更紧凑的表示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。