[论文解读] Learning robust speech representation with an articulatory-regularized variational autoencoder
本文提出了一种语音构音正则化变分自编码器(AR-VAE),通过约束潜在空间的某一部分以遵循来自EMA数据的构音轨迹,从而提升语音表征学习效果。与传统VAE相比,该方法加速了训练收敛,降低了重建损失,并提升了语音去噪性能,表明引入构音先验可实现更鲁棒且高效的语音表征学习。
It is increasingly considered that human speech perception and production both rely on articulatory representations. In this paper, we investigate whether this type of representation could improve the performances of a deep generative model (here a variational autoencoder) trained to encode and decode acoustic speech features. First we develop an articulatory model able to associate articulatory parameters describing the jaw, tongue, lips and velum configurations with vocal tract shapes and spectral features. Then we incorporate these articulatory parameters into a variational autoencoder applied on spectral features by using a regularization technique that constraints part of the latent space to follow articulatory trajectories. We show that this articulatory constraint improves model training by decreasing time to convergence and reconstruction loss at convergence, and yields better performance in a speech denoising task.
研究动机与目标
- 探究先验构音知识是否能够加速并改善变分自编码器中深度语音表征的学习过程。
- 评估在噪声条件下,构音约束是否能增强学习表征的鲁棒性。
- 开发一种联合构音-声学建模框架,将生理语音产生知识整合到潜在空间学习中。
- 评估构音正则化对语音重建质量与去噪性能的影响。
提出的方法
- 基于两名参考说话人的EMA数据(下颌、舌头、双唇、软腭)训练构音模型,以将构音参数映射到声道形状与频谱特征。
- 在从语音音频中提取的频谱特征(18个Bark尺度倒谱系数)上训练变分自编码器(VAE)。
- 在VAE损失函数中引入正则化项,约束潜在空间的子集遵循学习到的构音轨迹,强制与构音动力学对齐。
- 正则化采用潜在码与预测构音参数之间的加权重建损失,超参数α控制约束强度。
- 以传统VAE为基线进行模型评估,监控训练收敛速度与重建损失。
- 通过HMM-based音素解码准确率与MUSHRA主观质量评分,在多个信噪比(SNR)水平下评估语音去噪性能。
实验结果
研究问题
- RQ1先验构音知识是否能够加速VAE在语音表征学习中的训练过程?
- RQ2在噪声语音条件下,引入构音约束是否能提升学习表征的鲁棒性?
- RQ3AR-VAE与传统VAE相比,在重建质量与收敛速度方面表现如何?
- RQ4构音正则化是否能提升去噪任务中重建语音信号的感知质量?
主要发现
- AR-VAE在收敛速度与收敛时的重建损失方面均优于传统VAE,训练时间显著缩短。
- 在语音去噪任务中,AR-VAE在0 dB SNR下将音素解码准确率提升了12.5个百分点(从78.3%提升至90.8%),p < 0.001。
- MUSHRA评分在干净语音与10 dB SNR下表现出统计显著提升(p < 0.001),但在5 dB与0 dB SNR下无显著差异。
- AR-VAE在频谱重建保真度方面表现更优,尤其在保留共振峰过渡与构音动态方面。
- 当α = 1时正则化效果最佳,表明此时声学与构音约束达到最佳平衡。
- 结果表明,构音先验可增强潜在空间中学习到的语音表征的解耦性与可解释性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。