[论文解读] Robust Speaker Recognition Using Speech Enhancement And Attention Model
该论文提出了一种联合优化框架,通过多阶段注意力机制级联语音增强与说话人识别,以提升在噪声环境下的鲁棒性。通过将语音增强与说话人验证整合为一个端到端可训练的模型,并引入时间、频率和通道注意力机制,该方法在各种噪声条件下相较于强基线模型,于VoxCeleb1数据集上实现了最高3%的Top-1和Top-5准确率提升。
In this paper, a novel architecture for speaker recognition is proposed by cascading speech enhancement and speaker processing. Its aim is to improve speaker recognition performance when speech signals are corrupted by noise. Instead of individually processing speech enhancement and speaker recognition, the two modules are integrated into one framework by a joint optimisation using deep neural networks. Furthermore, to increase robustness against noise, a multi-stage attention mechanism is employed to highlight the speaker related features learned from context information in time and frequency domain. To evaluate speaker identification and verification performance of the proposed approach, we test it on the dataset of VoxCeleb1, one of mostly used benchmark datasets. Moreover, the robustness of our proposed approach is also tested on VoxCeleb1 data when being corrupted by three types of interferences, general noise, music, and babble, at different signal-to-noise ratio (SNR) levels. The obtained results show that the proposed approach using speech enhancement and multi-stage attention models outperforms two strong baselines not using them in most acoustic conditions in our experiments.
研究动机与目标
- 在由噪声引起的声学条件退化环境下,提升说话人识别的鲁棒性。
- 解决语音增强与说话人识别模块分别训练所带来的局限性,后者可能导致次优的特征学习。
- 将语音增强与说话人识别整合为一个端到端联合优化的统一框架。
- 通过采用多阶段注意力机制,突出时间、频率和通道维度上的说话人相关特征,以增强特征学习。
- 在真实噪声条件下(包括 babble、music 和一般噪声,且信噪比 SNR 水平各异),于标准基准上评估所提方法的性能。
提出的方法
- 该模型采用级联架构,先通过语音增强网络(SE-Net),再通过说话人识别网络(SID-Net),两者通过单一损失函数实现联合优化。
- SE-Net 使用11层空洞卷积层,并结合多阶段注意力(MS)模块,以抑制谱图输入中的噪声。
- 多阶段注意力机制由三个顺序模块组成:通道注意力、频率注意力和时间注意力,按级联方式应用,以突出相关特征。
- SID-Net 使用8层残差卷积层,并在其中插入多阶段注意力模块,以从增强后的谱图中提取鲁棒的说话人嵌入。
- 注意力模块被插入到 SE-Net 和 SID-Net 中每个卷积层之后,以根据特征的相关性动态加权。
- 整个模型使用 Adam 优化器进行训练,基础初始学习率为 1e-3,每轮学习率衰减率为 0.9。
实验结果
研究问题
- RQ1与分别训练相比,语音增强与说话人识别的联合优化是否能在噪声环境下提升性能?
- RQ2多阶段注意力机制的引入如何增强在不同噪声类型下的说话人识别鲁棒性?
- RQ3注意力机制的放置位置——在语音增强模块或说话人识别模块中——是否显著影响性能?
- RQ4所提方法在不同信噪比(SNR)水平以及 babble、music 和一般噪声等噪声类型下的表现如何?
- RQ5在不同模块中结合注意力机制(如 SE-MS+SID 和 SE+SID-MS)是否能进一步提升识别准确率?
主要发现
- 所提出的 SE+SID-MS 模型在所有噪声条件下,相较于基线 SID 模型,实现了 Top-1 和 Top-5 准确率 2–3% 的绝对提升。
- 在 SE-Net 和 SID-Net 中均使用多阶段注意力机制,即使在低 SNR 水平(如 0 dB)下,也带来了 1–2% 的相对性能提升,表明其具有更强的噪声鲁棒性。
- 在说话人验证任务中,SE-MS+SID 模型优于其他配置,尤其在低 SNR 的 babble 噪声环境下,增强模块中的注意力机制提供了显著性能优势。
- SE-MS+SID 与 SE+SID-MS 模型的线性组合带来了更优结果,其中 SE-MS+SID 成分对准确率的贡献更大,尤其在 babble 噪声中表现更突出。
- 联合优化框架优于先前使用微调说话人模型的方法,证明了端到端训练的优势。
- 该模型在所有噪声类型——一般噪声、音乐和 babble 噪声中均表现出一致的性能增益,证实其在多样化声学退化场景下的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。