Skip to main content
QUICK REVIEW

[论文解读] Feature Learning with Gaussian Restricted Boltzmann Machine for Robust Speech Recognition

Xin Zheng, Zhiyong Wu|arXiv (Cornell University)|Sep 23, 2013
Speech Recognition and Synthesis参考文献 12被引用 6
一句话总结

本文提出一种多变量高斯限制玻尔兹曼机(MGRBM),用于鲁棒语音识别的特征学习,通过捕捉语音帧之间的时序相关性,改进了传统MFCC方法。在Aurora2数据集上的实验表明,MGRBM提取的特征在低信噪比(SNR)条件下优于MFCC和标准GRBM特征,使用混合HMM-DNN模型时,在噪声环境中相对词错误率(WER)最高降低50%。

ABSTRACT

In this paper, we first present a new variant of Gaussian restricted Boltzmann machine (GRBM) called multivariate Gaussian restricted Boltzmann machine (MGRBM), with its definition and learning algorithm. Then we propose using a learned GRBM or MGRBM to extract better features for robust speech recognition. Our experiments on Aurora2 show that both GRBM-extracted and MGRBM-extracted feature performs much better than Mel-frequency cepstral coefficient (MFCC) with either HMM-GMM or hybrid HMM-deep neural network (DNN) acoustic model, and MGRBM-extracted feature is slightly better.

研究动机与目标

  • 开发一种深度表征学习方法,以减少在鲁棒语音识别中对人工设计特征(如MFCC)的依赖。
  • 解决标准GRBM在建模语音帧之间时序相关性方面的局限性。
  • 在降质声学条件(如低SNR和背景噪声)下提升识别准确率。
  • 证明通过MGRBM进行无监督特征学习可提升HMM-GMM和HMM-DNN系统的性能,且无需额外标注数据。

提出的方法

  • 提出一种新型高斯RBM变体,称为多变量高斯RBM(MGRBM),旨在建模多个相邻帧语音特征的协方差结构。
  • 使用对比分歧(CD)算法进行训练,条件概率基于能量模型推导:p(h_j=1|v) = sigmoid(b_j + Σ_i W_ij v_i / σ_i) 和 p(v_i|h) ~ N(a_i + σ_i Σ_j W_ij h_j, σ_i²)。
  • 应用主成分分析(PCA)将学习到的特征降维至39维,以实现与HMM-GMM的公平比较,但导致信息损失。
  • 采用堆叠自编码器预训练策略,随后使用反向传播进行微调,DNN包含4个隐藏层,每层1024个神经元。
  • 以9帧MFCC(351维)作为DNN的输入,所有输入均归一化为零均值和单位方差。
  • 在Aurora2语料库上,通过在多个SNR水平下评估词错误率(WER)来衡量性能。

实验结果

研究问题

  • RQ1在噪声环境中,像MGRBM这样的深度生成模型是否能学习到比传统MFCC更具判别性的语音特征?
  • RQ2在语音特征中建模帧间协方差是否能提升自动语音识别的鲁棒性?
  • RQ3MGRBM提取的特征在不同SNR水平下与MFCC和标准GRBM特征相比表现如何?
  • RQ4无监督特征学习结合MGRBM是否能在不依赖额外标注数据的情况下提升HMM-GMM和HMM-DNN系统的性能?

主要发现

  • 在Aurora2语料库上,MGRBM提取的特征在10dB SNR下达到15.79%的WER,优于MFCC(32.06%)和GRBM特征(25.85%),且在相同的HMM-DNN设置下表现更优。
  • 在5dB SNR下,MGRBM将WER降低至40.99%,而MFCC为59.75%,GRBM特征为58.05%,相比MFCC实现31.5%的相对提升。
  • 即使经过PCA降维(至39维),MGRBM特征在除干净语音外的所有SNR条件下均优于MFCC,表明其对信息损失具有鲁棒性。
  • 随着SNR降低,MGRBM与GRBM特征之间的性能差距扩大,表明MGRBM更能捕捉噪声鲁棒的表征。
  • 在最严峻的条件(-5dB SNR)下,MGRBM的WER为94.68%,而MFCC为106.20%,相比MFCC实现10.9%的相对改进。
  • 结果证实,通过MGRBM进行无监督特征学习可显著提升所有噪声水平下的识别性能,尤其在低SNR环境中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。