[论文解读] Audio Data Augmentation for Acoustic-to-articulatory Speech Inversion using Bidirectional Gated RNNs
本文提出一种双向门控循环神经网络(BiGRNN),用于基于梅尔频率倒谱系数(MFCCs)输入、六种声道变量(TVs)输出的语音声学到发音运动转换。结果表明,音频数据增强——尤其是添加背景噪声和音乐——不仅能提升在干净语音和嘈杂语音上的性能,还使皮尔逊积矩相关系数(PPMC)相对提升5%(达到0.7959),相较于先前的抗噪基线模型;通过说话人自适应进一步实现6%的性能增益。
Data augmentation has proven to be a promising prospect in improving the performance of deep learning models by adding variability to training data. In previous work with developing a noise robust acoustic-to-articulatory speech inversion system, we have shown the importance of noise augmentation to improve the performance of speech inversion in noisy speech. In this work, we compare and contrast different ways of doing data augmentation and show how this technique improves the performance of articulatory speech inversion not only on noisy speech, but also on clean speech data. We also propose a Bidirectional Gated Recurrent Neural Network as the speech inversion system instead of the previously used feed forward neural network. The inversion system uses mel-frequency cepstral coefficients (MFCCs) as the input acoustic features and six vocal tract-variables (TVs) as the output articulatory features. The Performance of the system was measured by computing the correlation between estimated and actual TVs on the U. Wisc. X-ray Microbeam database. The proposed speech inversion system shows a 5% relative improvement in correlation over the baseline noise robust system for clean speech data. The pre-trained model, when adapted to each unseen speaker in the test set, improves the average correlation by another 6%.
研究动机与目标
- 通过数据增强技术,提升语音声学到发音运动转换(SI)系统在干净语音和嘈杂语音数据上的性能。
- 用更具上下文感知能力的双向门控循环神经网络(BiGRNN)架构替代先前的前馈神经网络,以更好地建模发音运动中的时序动态特性。
- 评估数据增强是否能提升泛化能力,特别是针对未见说话人的泛化能力,通过提升在干净数据上的鲁棒性和性能来验证。
- 研究使用预训练模型在个体说话人数据上微调的说话人自适应方法的有效性。
- 将所提出的BiGRNN模型与BiLSTM和CNN-BiLSTM等成熟架构在XRMB数据集上的SI性能进行比较。
提出的方法
- 采用双向门控循环神经网络(BiGRNN)建模MFCC特征中的序列依赖关系,并预测六个声道变量(TVs)。
- 应用三种数据增强技术:时间拉伸、加性噪声和背景音乐增强,其中后者效果最佳。
- 在干净语音和增强数据上联合训练BiGRNN模型,以提升在不同语音条件下的鲁棒性和泛化能力。
- 将预训练的BiGRNN模型作为说话人自适应的起点,基于每个未见说话人少量数据进行微调。
- 在说话人自适应阶段采用早停策略和学习率调度,降低初始学习率并减小批量大小,以稳定小样本数据上的训练过程。
- 使用威斯康星州X射线微束(XRMB)数据库中估计值与实际TVs之间的皮尔逊积矩相关系数(PPMC)评估模型性能。
实验结果
研究问题
- RQ1音频数据增强是否不仅能提升在嘈杂语音上的性能,也能提升在干净语音数据上的性能?
- RQ2BiGRNN架构在从声学特征预测发音轨迹方面,是否优于先前的前馈神经网络?
- RQ3在有限目标说话人数据上,预训练的BiGRNN模型通过个性化自适应能实现多大程度的性能提升?
- RQ4在时间拉伸、加性噪声和背景音乐三种数据增强策略中,哪一种能生成最鲁棒且最准确的SI模型?
- RQ5在XRMB数据集上,所提出的BiGRNN模型在TV预测精度方面与BiLSTM和CNN-BiLSTM等成熟架构相比表现如何?
主要发现
- 所提出的BiGRNN模型在干净语音数据上相较于先前的抗噪基线模型,平均PPMC相对提升了5%(达到0.7959),表明即使在干净条件下,数据增强也能显著提升性能。
- 性能最佳的模型是通过使用背景音乐和噪声增强音频数据训练得到的,显著提升了模型在各种语音条件下的泛化能力。
- 经过说话人自适应后,平均PPMC得分从预训练模型的0.7942提升至0.8506,表明对未见说话人实现了显著的性能增益。
- 对于个别说话人如JW31,自适应模型的PPMC达到0.9106,表明其在TV轨迹估计方面相比通用模型在视觉和定量上均有明显改善。
- 在XRMB数据集上,BiGRNN在PPMC指标上优于BiLSTM和CNN-BiLSTM模型,尤其在使用增强数据训练时表现更优。
- 说话人自适应带来的性能提升在不同说话人之间并不一致,部分说话人(如JW61)仅获得微小增益,表明说话人个体发音特征存在差异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。