Skip to main content
QUICK REVIEW

[论文解读] Large-scale Self-Supervised Speech Representation Learning for Automatic Speaker Verification

Zhengyang Chen, Sanyuan Chen|arXiv (Cornell University)|Oct 12, 2021
Speech Recognition and Synthesis被引用 9
一句话总结

本论文提出使用预训练模型(Wav2Vec2.0、HuBERT、UniSpeech-SAT)所有隐藏层的自监督语音表征的加权平均池化方法,以提升基于 ECAPA-TDNN 的自动说话人验证(ASV)性能。该方法在 VoxCeleb1-E 上实现了 0.537% 的 EER,优于 VoxSRC2021 挑战赛该轮次的优胜模型,且表明预训练模型的低层比高层包含更多判别性说话人信息。

ABSTRACT

The speech representations learned from large-scale unlabeled data have shown better generalizability than those from supervised learning and thus attract a lot of interest to be applied for various downstream tasks. In this paper, we explore the limits of speech representations learned by different self-supervised objectives and datasets for automatic speaker verification (ASV), especially with a well-recognized SOTA ASV model, ECAPA-TDNN [1], as a downstream model. The representations from all hidden layers of the pre-trained model are firstly averaged with learnable weights and then fed into the ECAPA-TDNN as input features. The experimental results on Voxceleb dataset show that the weighted average representation is significantly superior to FBank, a conventional handcrafted feature for ASV. Our best single system achieves 0.537%, 0.569%, and 1.180% equal error rate (EER) on the three official trials of VoxCeleb1, separately. Accordingly, the ensemble system with three pre-trained models can further improve the EER to 0.479%, 0.536% and 1.023%. Among the three evaluation trials, our best system outperforms the winner system [2] of the VoxCeleb Speaker Recognition Challenge 2021 (VoxSRC2021) on the VoxCeleb1-E trial.

研究动机与目标

  • 探究大规模自监督语音表征是否能够提升如 ECAPA-TDNN 这类 SOTA 说话人验证系统的表现。
  • 确定结合预训练模型所有隐藏层表征是否优于仅使用最后一层表征。
  • 分析不同预训练模型层间说话人相关表征信息的分布情况。
  • 评估模型架构、预训练目标以及训练数据集规模对下游 ASV 性能的影响。
  • 对比自监督表征与传统手工设计特征(如 FBank)在性能上的有效性。

提出的方法

  • 该方法使用可学习的加权平均池化方式,将预训练模型(Wav2Vec2.0、HuBERT、UniSpeech-SAT)所有隐藏层的表征作为 ECAPA-TDNN 的输入。
  • 权重在下游训练过程中端到端进行学习,使模型能够自动学习各层对说话人判别贡献的最大程度。
  • 预训练模型与 ECAPA-TDNN 分类器在 VoxCeleb1 和 VoxCeleb2 数据集上联合进行微调。
  • 研究对比了不同架构(base 与 large)、预训练目标(对比学习、掩码预测)以及训练数据规模(XLSR、LibriSpeech 等)的模型表现。
  • 通过消融实验评估冻结与微调预训练编码器的影响。
  • 通过归一化的注意力权重可视化各层重要性,分析说话人信息在模型中的集中位置。

实验结果

研究问题

  • RQ1能否利用大规模无标签数据训练的自监督语音表征,提升如 ECAPA-TDNN 这类 SOTA 说话人验证系统的性能?
  • RQ2使用所有隐藏层表征的加权平均是否优于仅使用最后一层表征?
  • RQ3哪种预训练模型架构与预训练目标能为说话人验证带来最佳性能?
  • RQ4在预训练模型中(即哪一层),最具判别性的说话人信息最为集中?
  • RQ5联合微调预训练模型与下游分类器对系统性能有何影响?

主要发现

  • 所提出的可学习加权平均所有隐藏层表征的方法在 VoxCeleb1-E 任务上实现了 0.537% 的等错误率(EER),优于 VoxSRC2021 挑战赛该轮次的优胜模型。
  • 三个预训练模型的集成进一步将 VoxCeleb1-E 的 EER 降低至 0.479%,证明了该方法的鲁棒性。
  • 自监督表征显著优于传统 FBank 特征,在所有 VoxCeleb1 任务上实现了约 30% 的相对 EER 改进。
  • 低层(尤其是大规模模型如 UniSpeech-SAT_Large 和 Wav2Vec2.0_Large)的预训练模型包含比高层更多的判别性说话人信息,表现为更高的学习权重。
  • 在更大的 VoxCeleb2_dev 数据集上,微调预训练模型带来的性能增益高于 VoxCeleb1_dev,表明数据规模影响微调的有效性。
  • 微调后,Wav2Vec2.0_Large (XLSR) 和 UniSpeech-SAT_Large 模型表现最佳,后者在 VoxCeleb1-E 上实现了最低的 EER 0.537%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。