[论文解读] Robust Speaker Recognition with Transformers Using wav2vec 2.0
该论文提出了一种使用wav2vec 2.0预训练模型微调TDNN和统计池化后端的鲁棒说话人识别系统,在多种数据集上实现了最先进性能。结果表明,通过在小规模、干净的数据集上进行微调并结合数据增强,可实现强大的泛化能力,尤其在电话和跨信道条件下表现优异,在VoxCeleb1-O上的EER为0.69%,在SRE 2019上的EER为1.71%。
Recent advances in unsupervised speech representation learning discover new approaches and provide new state-of-the-art for diverse types of speech processing tasks. This paper presents an investigation of using wav2vec 2.0 deep speech representations for the speaker recognition task. The proposed fine-tuning procedure of wav2vec 2.0 with simple TDNN and statistic pooling back-end using additive angular margin loss allows to obtain deep speaker embedding extractor that is well-generalized across different domains. It is concluded that Contrastive Predictive Coding pretraining scheme efficiently utilizes the power of unlabeled data, and thus opens the door to powerful transformer-based speaker recognition systems. The experimental results obtained in this study demonstrate that fine-tuning can be done on relatively small sets and a clean version of data. Using data augmentation during fine-tuning provides additional performance gains in speaker verification. In this study speaker recognition systems were analyzed on a wide range of well-known verification protocols: VoxCeleb1 cleaned test set, NIST SRE 18 development set, NIST SRE 2016 and NIST SRE 2019 evaluation set, VOiCES evaluation set, NIST 2021 SRE, and CTS challenges sets.
研究动机与目标
- 研究端到端微调在说话人识别中使用wav2vec 2.0表征的有效性。
- 评估变压器层选择和数据增强对模型在不同领域泛化能力的影响。
- 在多个标准基准上,对比基于wav2vec 2.0的模型与传统ResNet和ECAPA-TDNN基线模型的性能。
- 确定在使用无监督预训练模型(如wav2vec 2.0)时,小规模、干净的训练集是否足以实现鲁棒的说话人嵌入学习。
- 评估在使用强大预训练模型(如wav2vec 2.0)时,是否需要复杂的后端或前端结构。
提出的方法
- 使用添加角边缘的软最大损失(AAM-Softmax),边际m=0.35,缩放因子s=32,微调了一个大规模多语言wav2vec 2.0模型(XLS-R-1B和XLSR-53)。
- 采用TDNN和统计池化后端,从选定的wav2vec 2.0编码器层中提取固定维数的说话人嵌入。
- 选择XLSR-53模型的第6层和XLS-R-1B模型的第12层作为说话人识别的最佳层,避免使用完整编码器。
- 在微调过程中应用在线数据增强(如速度扰动、噪声注入)以提升鲁棒性。
- 首先在短语音段(4–6秒)上进行训练,然后在更长的语音段(12–18秒)上进行微调,以提升泛化能力。
- 使用循环学习率调度策略,并结合基于U-Net的VAD进行前端处理,采用均值归一化。
实验结果
研究问题
- RQ1在少量监督和小规模数据集下,wav2vec 2.0表征是否能有效微调用于说话人识别?
- RQ2wav2vec 2.0中的哪个变压器编码器层在性能与计算成本之间提供了最佳平衡,适用于说话人嵌入提取?
- RQ3在微调过程中应用数据增强是否能提升低资源或跨领域设置下的鲁棒性?
- RQ4基于wav2vec 2.0的系统在多种评估协议下与强基线模型(如ResNet101和ECAPA-TDNN)相比表现如何?
- RQ5对于基于变压器的模型,使用对比预测编码进行无监督预训练是否对实现高性能说话人识别至关重要?
主要发现
- wav2vec-TDNN(XLSR-53)模型在VoxCeleb1-O(清理后)测试集上实现了0.69%的EER,优于基线模型。
- wav2vec-TDNN(XLS-R_1B)模型在NIST SRE 2019评估集上实现了1.71%的EER,表现出强大的跨领域泛化能力。
- 使用XLSR-53的第6层和XLS-R_1B的第12层,性能与深层相当,同时降低了计算成本且未造成性能损失。
- 在微调过程中应用数据增强显著提升了电话和跨信道数据集上的性能,尤其在训练数据有限时效果更明显。
- 在小规模、干净的数据集(如VC1中的1211名说话人)上进行微调即可获得最先进结果,表明无监督预训练具备强大的零样本泛化能力。
- 从零开始训练wav2vec 2.0模型失败,证实了大规模无标签数据预训练对有效说话人嵌入学习的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。