[论文解读] Exploring wav2vec 2.0 on speaker verification and language identification
本文探讨了使用自监督预训练的wav2vec 2.0在说话人验证(SV)和语言识别(LID)中的应用。结果表明,wav2vec 2.0即使在无任务特定预训练的情况下,也能学习到具有判别性的说话人和语言表征,实现了在VoxCeleb1上的说话人验证新SOTA结果,EER为3.61%,在完整长度AP17-OLR上的语言识别EER为3.47%,并通过统一的多任务模型在减少参数量的同时保持了优异性能。
Wav2vec 2.0 is a recently proposed self-supervised framework for speech representation learning. It follows a two-stage training process of pre-training and fine-tuning, and performs well in speech recognition tasks especially ultra-low resource cases. In this work, we attempt to extend self-supervised framework to speaker verification and language identification. First, we use some preliminary experiments to indicate that wav2vec 2.0 can capture the information about the speaker and language. Then we demonstrate the effectiveness of wav2vec 2.0 on the two tasks respectively. For speaker verification, we obtain a new state-of-the-art result, Equal Error Rate (EER) of 3.61% on the VoxCeleb1 dataset. For language identification, we obtain an EER of 12.02% on 1 second condition and an EER of 3.47% on full-length condition of the AP17-OLR dataset. Finally, we utilize one model to achieve the unified modeling by the multi-task learning for the two tasks.
研究动机与目标
- 探究wav2vec 2.0的自监督预训练是否能够捕捉对下游任务有用的说话人与语言信息。
- 评估wav2vec 2.0在微调说话人验证与语言识别任务时的有效性。
- 通过多任务学习联合优化SV与LID,使用单一统一模型,以降低模型复杂度与训练成本。
- 证明在大规模无标签语音上进行与任务无关的预训练,可为说话人与语言相关任务生成强表征。
提出的方法
- 使用对比预测编码在大规模无标签语音上预训练wav2vec 2.0模型,采用CNN编码器、Transformer上下文网络和向量量化码本。
- 从预训练的w2v-编码器中提取上下文表征,并使用t-SNE进行可视化,以评估说话人与语言的可分性。
- 通过在预训练w2v-编码器上添加任务特定头(全连接层)进行微调,分别在VoxCeleb1上进行说话人验证,在AP17-OLR上进行语言识别。
- 通过在共享w2v-编码器上添加两个并行分类头,实现多任务学习设置,同时进行SV与LID预测,并采用加权损失函数。
- 在微调过程中使用学习率预热和线性衰减调度,并对编码器初始权重进行冻结以稳定训练。
- 使用测试集上的等错误率(EER)评估性能,并与基线方法(如i-vector + PLDA和TDNN)进行比较。

实验结果
研究问题
- RQ1wav2vec 2.0的自监督预训练是否能在无任务特定监督的情况下学习到对说话人与语言具有判别性的表征?
- RQ2与现有SOTA方法相比,wav2vec 2.0在说话人验证与语言识别上的表现如何?
- RQ3通过多任务学习训练的单一统一模型是否能有效处理说话人验证与语言识别,同时减少参数量?
- RQ4预训练是否能缓解低资源设置下的语言识别任务中的过拟合问题?
主要发现
- 预训练的wav2vec 2.0模型在VoxCeleb1数据集上的说话人验证任务中实现了新的SOTA EER 3.61%。
- 在语言识别任务中,模型在AP17-OLR数据集的1秒条件下的EER为12.02%,在完整长度条件下的EER为3.47%。
- 可视化结果表明,即使在无任务特定预训练的情况下,预训练模型的低层也表现出更强的说话人与语言可分性。
- 多任务学习模型在SV任务上达到EER 4.18%,在LID任务上达到EER 4.88%,表明通过更少参数实现了有效的统一建模。
- 与从零开始训练相比,从预训练模型进行微调显著降低了过拟合,尤其在LID的低资源设置下表现更优。
- 预训练与非预训练模型在LID任务上的性能差距显著,表明自监督预训练具有显著优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。