[论文解读] End-to-End Attention based Text-Dependent Speaker Verification
本文提出了一种端到端的基于注意力机制的文本依赖说话人验证系统,利用说话人判别性卷积神经网络(CNN)提取抗噪的帧级特征,再通过可学习的注意力机制将这些特征融合,生成话语级表征。整个系统通过端到端准则进行联合优化,自动为每个目标说话人选择最相似的伪造说话人,从而在 Windows 10 的“Hey Cortana”任务中实现了 4.1% 的等错误率(EER),相比 i-vector/PLDA 基线系统相对降低了 9%。
A new type of End-to-End system for text-dependent speaker verification is presented in this paper. Previously, using the phonetically discriminative/speaker discriminative DNNs as feature extractors for speaker verification has shown promising results. The extracted frame-level (DNN bottleneck, posterior or d-vector) features are equally weighted and aggregated to compute an utterance-level speaker representation (d-vector or i-vector). In this work we use speaker discriminative CNNs to extract the noise-robust frame-level features. These features are smartly combined to form an utterance-level speaker vector through an attention mechanism. The proposed attention model takes the speaker discriminative information and the phonetic information to learn the weights. The whole system, including the CNN and attention model, is joint optimized using an end-to-end criterion. The training algorithm imitates exactly the evaluation process --- directly mapping a test utterance and a few target speaker utterances into a single verification score. The algorithm can automatically select the most similar impostor for each target speaker to train the network. We demonstrated the effectiveness of the proposed end-to-end system on Windows $10$ "Hey Cortana" speaker verification task.
研究动机与目标
- 开发一种端到端说话人验证系统,直接将语音样本映射为验证分数,无需中间表征。
- 通过利用说话人判别性 CNN 进行帧级特征提取,提升文本依赖说话人验证的鲁棒性与性能。
- 通过用注意力机制替代等权重平均,动态根据说话人和语音内容加权信息丰富的帧,从而增强话语级表征学习。
- 通过端到端准则联合训练整个系统,模拟真实评估过程,包括自动选择最具挑战性的伪造说话人样本。
提出的方法
- 三通道 CNN 处理由静态、一阶差分和二阶差分 MFCC 特征构成的输入,采用非对称感受野(t-25 到 t+5),以提取说话人判别性帧级特征。
- 注意力机制利用说话人判别性信息和语音内容信息,为帧级特征学习动态权重,生成紧凑的话语级说话人向量。
- 注意力机制基于缩放点积注意力模块,计算上下文感知权重,并使用 softplus 激活函数确保注意力分数非负。
- 整个系统(包括 CNN 和注意力网络)通过端到端损失函数进行联合优化,直接将测试语音和目标说话人语音映射为验证分数。
- 训练过程中,算法通过说话人向量池自动为每个目标说话人选择最相似的伪造说话人,模拟真实环境下的拒绝场景。
- 训练采用小批量策略,每个说话人 N=6 个注册语音样本,负样本与正样本的比例为 T₁=1,T₂=5,以匹配实际评估条件。
实验结果
研究问题
- RQ1一种端到端系统,联合优化特征提取与评分,是否能在文本依赖说话人验证中超越传统流水线式方法?
- RQ2一种同时考虑说话人和语音内容信息的注意力机制,相比均匀平均,如何提升话语级说话人表征的质量?
- RQ3在端到端训练中,使用说话人向量池自动选择最具挑战性的伪造说话人样本,其影响是什么?
- RQ4与 DNN 或 LSTM 相比,基于 CNN 的特征提取器在文本依赖说话人验证中的性能与鲁棒性如何?
- RQ5对整个网络架构进行联合优化,在真实世界关键词触发的说话人验证任务中,对验证准确率的提升程度如何?
主要发现
- 所提出的端到端系统在 Windows 10 的“Hey Cortana”说话人验证任务中实现了 4.1% 的等错误率(EER),相比 i-vector/PLDA 基线系统相对误差降低了 9%。
- 在训练中使用说话人向量池选择最相似伪造说话人,使 EER 从随机采样的 4.6% 降低至 4.1%,证明了真实负样本采样的重要性。
- 所提出的可学习权重注意力机制(而非后验概率加权注意力)表现最佳,将 EER 降低至 4.1%,而后者为 4.5%。
- 基于 CNN 的特征提取器相比参数数量相同的 DNN,相对误差降低了 6%,表明 CNN 在说话人判别性表征学习中具有优势。
- 端到端系统相比 GMM-UBM 和 i-vector/PLDA 基线系统,分别实现了 25% 和 9% 的相对误差降低,验证了联合优化的优势。
- 该系统在真实世界、短语音、关键词触发的说话人验证任务中达到了最先进性能,验证了其实际应用价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。