QUICK REVIEW
[论文解读] Clova Baseline System for the VoxCeleb Speaker Recognition Challenge 2020
Hee Soo Heo, Bong‐Jin Lee|arXiv (Cornell University)|Sep 29, 2020
Speech Recognition and Synthesis参考文献 18被引用 96
一句话总结
本文展示了 Clova 基于 ResNet 的 VoxSRC 2020 基线,探讨多种损失函数和池化机制以在不使用集成或后处理的情况下提升说话人识别。它报告了强大的单模型结果,并将训练代码和模型以非官方基线的形式发布。
ABSTRACT
This report describes our submission to the VoxCeleb Speaker Recognition Challenge (VoxSRC) at Interspeech 2020. We perform a careful analysis of speaker recognition models based on the popular ResNet architecture, and train a number of variants using a range of loss functions. Our results show significant improvements over most existing works without the use of model ensemble or post-processing. We release the training code and pre-trained models as unofficial baselines for this year's challenge.
研究动机与目标
- 在 VoxCeleb 数据上评估在 VoxSRC 2020 条件下的有效 ResNet 架构(域迁移、简短说话段)。
- 研究不同损失函数(AM-Softmax、AAM-Softmax、AP、AP+Softmax)和 pooling(SAP、ASP)对性能的影响。
- 评估输入表示和增强策略,以提高在不受约束的语音中的鲁棒性。
- 通过公开训练代码和预训练模型为社区提供非官方基线。
提出的方法
- 使用固定长度 2 秒段、64 维对数梅尔滤波器组和通过实例归一化的 MVN 作为输入特征。
- 比较两种 ResNet-34 变体:一个用于加速的模型,参数为 1.4M 且使用 SAP;一个用于性能优化的模型,参数为 8.0M 且使用 ASP。
- 应用度量学习和基于分类的损失(AM-Softmax、AAM-Softmax、AP、AP+Softmax)以学习判别性的说话人嵌入。
- 使用基于注意力的池化(SAP/ASP)聚合帧级特征以获得句子级表示。
- 在 VoxCeleb2 开发集上训练,并在测试段的 10 个裁剪上使用余弦相似度进行评估,平均 100 对配对的相似度。
- 采用数据增强,包括 MUSAN 噪声/音乐/其他噪声以及模拟的房间脉冲响应 (RIRs)。
- 在 NSML 平台上用 PyTorch 实施,跨多块 GPU 进行分布式训练;仅报告不进行模型集成的结果。
实验结果
研究问题
- RQ1在不进行模型集成的情况下,基于 ResNet 的骨干网络结合注意力池化是否能达到或超越之前的 VoxSRC 基线?
- RQ2在不受约束条件下,AM-Softmax、AAM-Softmax、AP 以及 AP+Softmax 损失在说话人验证中的表现如何比较?
- RQ3在 VoxCeleb 数据中使用 SAP 与 ASP 对句子级判别力有何影响?
- RQ4在嵌入上进行 BN(Batch Normalization)是否会提升用于分类目标的性能?
主要发现
- 一个用于加速的 Q/SAP 模型和一个用于性能优化的 H/ASP 模型被开发并在多种损失下进行了比较。
- 度量学习和基于分类的损失的组合通常在各种情景中取得最佳性能。
- 嵌入 BN 为基于分类的目标提供了显著提升。
- 最佳单模型(AP+Softmax 与 H/ASP)实现了具有竞争力的结果,VoxSRC 2020 测试集的最佳性能报道为 EER 5.19% 和 MinDCF 0.314。
- 作者在不依赖模型集成或后处理的情况下展示了强结果,并向社区发布了训练代码和预训练基线。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。