[论文解读] Convolutional Speech Recognition with Pitch and Voice Quality Features
本文提出在卷积神经网络(Conv GLU)中融合基频、抖动(jitter)和闪烁(shimmer)特征与梅尔频率倒谱系数(MFSCs),以实现端到端自动语音识别。通过将这些韵律和语音质量特征附加到MFSC输入上,模型在西班牙语Common Voice数据集上实现了高达7%的相对WER降低,在LibriSpeech数据集上实现了2.94%的降低,表明在多样化或非纯净环境下的鲁棒性显著提升。
The effects of adding pitch and voice quality features such as jitter and shimmer to a state-of-the-art CNN model for Automatic Speech Recognition are studied in this work. Pitch features have been previously used for improving classical HMM and DNN baselines, while jitter and shimmer parameters have proven to be useful for tasks like speaker or emotion recognition. Up to our knowledge, this is the first work combining such pitch and voice quality features with modern convolutional architectures, showing improvements up to 7% and 3% relative WER points, for the publicly available Spanish Common Voice and LibriSpeech 100h datasets, respectively. Particularly, our work combines these features with mel-frequency spectral coefficients (MFSCs) to train a convolutional architecture with Gated Linear Units (Conv GLUs). Such models have shown to yield small word error rates, while being very suitable for parallel processing for online streaming recognition use cases. We have added pitch and voice quality functionality to Facebook's wav2letter speech recognition framework, and we provide with such code and recipes to the community, to carry on with further experiments. Besides, to the best of our knowledge, our Spanish Common Voice recipe is the first public Spanish recipe for wav2letter.
研究动机与目标
- 探究基频和语音质量特征(jitter、shimmer)是否能提升现代卷积ASR模型的性能。
- 弥合手工设计的韵律特征与端到端深度学习架构之间的差距。
- 为wav2letter框架提供基频和语音质量特征的开源训练配方与代码集成。
- 为wav2letter建立首个公开的西班牙语Common Voice训练配方。
- 评估这些特征在多样化语音条件(如不同口音和语音障碍)下的鲁棒性影响。
提出的方法
- 该模型采用Conv GLU架构,利用门控线性单元实现深层、可并行训练,并实现低WER。
- 从原始音频中提取基频、jitter和shimmer特征,并在输入层与MFSCs拼接,无需修改网络架构。
- 框架在Facebook的wav2letter基础上扩展,集成了基频和语音质量特征提取流程。
- 实验在两个公开数据集上进行:西班牙语Common Voice和LibriSpeech 100h,采用标准训练和解码协议。
- 该方法通过避免后处理或专用滤波器,保持简洁,专注于在输入层进行特征拼接。
- 性能通过在dev-clean、dev-other、test-clean和test-other划分上的词错误率(WER)进行评估。
实验结果
研究问题
- RQ1基频和语音质量特征(jitter、shimmer)是否能提升如Conv GLU等现代卷积ASR模型的性能?
- RQ2在非纯净或带有口音的语音条件下,这些特征如何影响ASR的鲁棒性?
- RQ3当与MFSCs结合时,基频、jitter和shimmer的相对贡献是什么?
- RQ4仅在输入层进行简单的韵律特征拼接,是否能在不修改架构的前提下显著提升WER?
- RQ5与英语等高资源语言相比,这些特征在低资源语言(如西班牙语)模型上的影响如何?
主要发现
- 在西班牙语Common Voice数据集中,添加基频、jitter和shimmer特征后,WER相对降低了高达7%,尤其在dev-other和test-other集上表现更优。
- 在LibriSpeech 100h数据集中,使用MFSC+pitch+jitter+shimmer的模型在dev-clean集上实现了2.94%的相对WER提升,在test-other集上实现了2.87%的提升。
- 三种韵律特征(基频、jitter、shimmer)的组合在所有测试集上均表现出最一致且最鲁棒的性能。
- MFSC+pitch+jitter+shimmer优于仅MFSC或MFSC+pitch的基线模型,表明语音质量特征具有附加价值。
- 在非纯净和韵律多样的条件下(如dev-other),性能提升更为显著,表明对口音和变异性具有更强的鲁棒性。
- 本研究证实,即使在极少架构调整的情况下,基频和语音质量特征在现代卷积ASR中依然有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。