[论文解读] Learning Speaker Embedding with Momentum Contrast
本文提出在语音验证任务中使用动量对比(Momentum Contrast, MoCo)进行无监督和自监督的说话人嵌入学习。通过结合基于SpecAugment的数据增强技术,该方法学习到更具判别性的说话人表征,其性能优于标准的交叉熵预训练方法,在微调下游任务时实现了13.7%的相对EER提升。
Speaker verification can be formulated as a representation learning task, where speaker-discriminative embeddings are extracted from utterances of variable lengths. Momentum Contrast (MoCo) is a recently proposed unsupervised representation learning framework, and has shown its effectiveness for learning good feature representation for downstream vision tasks. In this work, we apply MoCo to learn speaker embedding from speech segments. We explore MoCo for both unsupervised learning and pretraining settings. In the unsupervised scenario, embedding is learned by MoCo from audio data without using any speaker specific information. On a large scale dataset with $2,500$ speakers, MoCo can achieve EER $4.275\%$ trained unsupervisedly, and the EER can decrease further to $3.58\%$ if extra unlabelled data are used. In the pretraining scenario, encoder trained by MoCo is used to initialize the downstream supervised training. With finetuning on the MoCo trained model, the equal error rate (EER) reduces $13.7\%$ relative ($1.44\%$ to $1.242\%$) compared to a carefully tuned baseline training from scratch. Comparative study confirms the effectiveness of MoCo learning good speaker embedding.
研究动机与目标
- 探究动量对比(MoCo)是否能在无说话人标签的情况下有效学习说话人判别性嵌入。
- 评估MoCo作为下游监督型说话人验证系统预训练方法的性能。
- 从下游性能角度,对比MoCo预训练与传统交叉熵预训练方法的差异。
- 评估额外未标注数据对MoCo表征学习能力的影响。
提出的方法
- 通过使用双分支编码器与动量更新的键(keys),将MoCo适配于语音任务,其中正样本对为同一语音片段的增强版本。
- 应用基于SpecAugment的数据增强技术,从同一语音片段生成正样本对,以支持对比学习。
- 维护一个动态负样本键队列,以稳定训练并提升表征质量。
- 采用基于点积相似度(余弦相似度)的对比损失,计算锚点与键表征之间的相似性。
- 在下游监督训练中,使用AAM(加法角Margin)损失对MoCo学习到的编码器进行微调。
- 利用内部数据集和VoxCeleb数据集,评估在不同设置下的无监督学习与预训练性能。
实验结果
研究问题
- RQ1MoCo能否在无任何说话人身份监督的情况下,以无监督方式有效学习说话人嵌入?
- RQ2与标准交叉熵预训练相比,MoCo预训练是否能提升下游说话人验证性能?
- RQ3额外未标注数据的引入如何影响MoCo在说话人嵌入学习中的表现?
- RQ4MoCo学习到的表征是否与现代判别性损失函数(如AAM)兼容?
- RQ5在EER和minDCF指标上,MoCo与传统i-vector和x-vector基线方法相比表现如何?
主要发现
- 在无监督设置下,MoCo在2,500名说话人数据集上达到EER为4.275%,在引入额外未标注数据后进一步降低至3.58%。
- 当用作预训练方法时,MoCo将同一数据集上的EER从1.44%降低至1.242%(相对提升13.7%),在使用AAM损失微调后实现。
- 交叉熵预训练无法提升下游AAM训练性能,甚至可能造成性能下降,而MoCo预训练则表现出明显优势。
- 在VoxCeleb1数据集上,MoCo预训练将EER降至2.402%(使用余弦后端),优于交叉熵预训练和标准AAM模型。
- MoCo学习到的表征泛化能力良好,在不同评估协议和后端设置下均表现出一致的性能提升。
- MoCo预训练带来的性能增益在各项指标上均保持一致,包括minDCF 0.01和minDCF 0.001,证实其在不同误报与漏报权衡下的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。