[论文解读] Maximum a Posteriori Adaptation of Network Parameters in Deep Models
本文提出了一种用于上下文相关DNN-HMM系统中深度神经网络(DNN)参数的贝叶斯最大后验概率(MAP)自适应框架,采用增强线性隐藏网络(LHN)以在自适应数据有限的情况下稳定参数更新。该方法优于传统的基于变换的自适应方法和特征空间MAP线性回归,在Wall Street Journal 20k词汇量任务中实现了超过10%的相对词错误率降低,并通过分层先验首次成功提升了数据效率。
We present a Bayesian approach to adapting parameters of a well-trained context-dependent, deep-neural-network, hidden Markov model (CD-DNN-HMM) to improve automatic speech recognition performance. Given an abundance of DNN parameters but with only a limited amount of data, the effectiveness of the adapted DNN model can often be compromised. We formulate maximum a posteriori (MAP) adaptation of parameters of a specially designed CD-DNN-HMM with an augmented linear hidden networks connected to the output tied states, or senones, and compare it to feature space MAP linear regression previously proposed. Experimental evidences on the 20,000-word open vocabulary Wall Street Journal task demonstrate the feasibility of the proposed framework. In supervised adaptation, the proposed MAP adaptation approach provides more than 10% relative error reduction and consistently outperforms the conventional transformation based methods. Furthermore, we present an initial attempt to generate hierarchical priors to improve adaptation efficiency and effectiveness with limited adaptation data by exploiting similarities among senones.
研究动机与目标
- 为解决在训练与测试条件不匹配时DNN-HMM系统性能下降的问题,特别是在自适应数据有限的情况下。
- 通过贝叶斯参数估计引入先验知识,克服DNN自适应中的灾难性遗忘问题。
- 通过利用音素单元之间的结构相似性,提升低资源自适应场景下的自适应效率与效果。
- 将先前用于GMM-HMM系统的贝叶斯自适应技术扩展至混合ASR系统中的深度神经网络。
- 探索基于音素聚类的分层先验,以在自适应数据极少时提升参数估计性能。
提出的方法
- 在最后一个非线性隐藏层之后引入增强线性隐藏网络(LHN),以建模DNN参数的自适应。
- 将LHN权重视为具有高斯先验的随机变量,通过MAP估计正则化自适应过程,减少过拟合。
- 推导出一个联合目标函数,结合交叉熵损失项与L2正则化项,分别作用于LHN权重及其分层父节点。
- 采用固定的两层树状结构,根据共享的语音上下文对音素单元进行分组,实现对音素嵌入的分层先验。
- 使用分层先验模型,其中每个音素嵌入条件分布于其父节点均值周围,且两层均赋予高斯先验。
- 通过梯度下降优化MAP目标函数,自适应过程中保持主DNN权重固定。
实验结果
研究问题
- RQ1在自适应数据有限的情况下,DNN参数的贝叶斯MAP自适应是否能提升DNN-HMM系统的性能?
- RQ2基于MAP的LHN自适应与传统的基于变换的自适应及特征空间MAP线性回归方法相比表现如何?
- RQ3基于音素结构的分层先验是否能提升小样本自适应集下的自适应效率?
- RQ4分层先验的使用是否能减少DNN自适应中的过拟合与灾难性遗忘?
- RQ5来自音素相似性聚类的先验知识是否能增强低数据场景下的参数估计?
主要发现
- 所提出的MAP LHN自适应方法在Wall Street Journal 20k词汇量任务中,相较于强大的说话人无关CD-DNN-HMM基线,实现了超过10%的相对词错误率降低。
- 在监督自适应设置下,MAP LHN始终优于传统的基于变换的自适应方案和特征空间MAP线性回归方法。
- 仅使用5句自适应数据时,分层先验将WER从8.54%(平坦先验)降低至8.48%,显示出在数据稀缺场景下的早期潜力。
- 使用10句自适应数据时,分层先延将WER从8.52%降至8.45%,表明结构化先验带来了渐进性提升。
- 分层先验结构通过在相似音素间共享统计强度,实现了更稳定的参数更新,降低了过拟合风险。
- 该方法证明了在混合ASR系统中,将贝叶斯参数估计应用于大规模DNN的可行性,尤其在低数据自适应场景中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。