[论文解读] Improvement of Text Dependent Speaker Identification System Using Neuro-Genetic Hybrid Algorithm in Office Environmental Conditions
本文提出一种神经-遗传混合算法,以提升在办公室类噪声环境下的文本依赖型说话人识别性能。通过结合维纳滤波、倒谱特征(MFCC、LPC等)以及神经-遗传优化框架,该系统在办公室环境下实现了82.33%的识别准确率,展现出在真实声学环境下的鲁棒性。
In this paper, an improved strategy for automated text dependent speaker identification system has been proposed in noisy environment. The identification process incorporates the Neuro- Genetic hybrid algorithm with cepstral based features. To remove the background noise from the source utterance, wiener filter has been used. Different speech pre-processing techniques such as start-end point detection algorithm, pre-emphasis filtering, frame blocking and windowing have been used to process the speech utterances. RCC, MFCC, MFCC, MFCC, LPC and LPCC have been used to extract the features. After feature extraction of the speech, Neuro-Genetic hybrid algorithm has been used in the learning and identification purposes. Features are extracted by using different techniques to optimize the performance of the identification. According to the VALID speech database, the highest speaker identification rate of 100.000 percent for studio environment and 82.33 percent for office environmental conditions have been achieved in the close set text dependent speaker identification system.
研究动机与目标
- 提升在背景噪声导致传统系统性能下降的办公室噪声环境中的说话人识别性能。
- 解决在真实世界非理想声学条件下,文本依赖型说话人识别系统识别准确率低的问题。
- 开发一种混合学习机制,结合神经网络与遗传算法,实现最优特征分类。
- 利用VALID语音数据库,在录音室与办公室两种条件下评估系统性能。
- 通过多种基于倒谱的特征提取技术(MFCC、LPC等)优化特征提取与选择,以提升区分能力。
提出的方法
- 在处理前对语音语句应用维纳滤波以降低背景噪声。
- 采用语音预处理步骤:语音活动检测(起止点检测)、预加重滤波、分帧处理及汉明窗加权。
- 提取多种倒谱特征:MFCC、LPC、LPCC与RCC,以实现鲁棒的说话人表征。
- 采用神经-遗传混合算法——利用遗传算法对神经网络权重与结构进行全局优化,随后通过神经网络训练完成分类。
- 通过遗传算法结合特征选择与参数调优,优化系统以提升收敛性与准确率。
- 在封闭集配置下,利用VALID语音数据库在受控(录音室)与噪声(办公室)条件下评估系统性能。
实验结果
研究问题
- RQ1与传统方法相比,神经-遗传混合算法是否能显著提升在办公室噪声环境下的说话人识别准确率?
- RQ2维纳滤波在降低背景噪声方面对文本依赖型说话人识别系统的效果如何?
- RQ3在多种倒谱特征(MFCC、LPC、LPCC、RCC)中,哪一组合在噪声条件下能实现最高识别准确率?
- RQ4遗传算法优化的集成在多大程度上提升了基于神经网络的说话人分类器性能?
- RQ5在真实世界办公室类声学条件下,该系统可实现的识别率是多少?
主要发现
- 在使用VALID数据库的受控录音室环境下,该系统实现了100%的说话人识别准确率。
- 在办公室环境条件下,系统识别准确率达到82.33%,展现出对真实世界噪声的鲁棒性。
- 神经-遗传混合算法通过遗传搜索优化神经网络权重与结构,显著提升了分类性能。
- 维纳滤波有效降低了背景噪声,提升了信噪比,改善了特征提取质量。
- 在所测试的倒谱特征中,MFCC、LPC、LPCC与RCC共同提升了在噪声环境下的说话人区分能力。
- 预处理技术(预加重、窗加权、分帧)的组合增强了特征稳定性与系统可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。