[论文解读] The JHU submission to VoxSRC-21: Track 3
本论文提出一种自监督说话人验证系统,采用非对比性 DINO 方法进行初始模型预训练,随后通过伪标签迭代聚类与在 Res2Net50 上的鲁棒训练。该方法在 VoxCeleb1-O、VoxSRC-21 验证集和测试集上的等错误率(EER)分别达到 1.91%、6.32% 和 6.64%,优于对比学习基线模型,并因初始嵌入质量更高而减少了迭代聚类的步骤数。
This technical report describes Johns Hopkins University speaker recognition system submitted to Voxceleb Speaker Recognition Challenge 2021 Track 3: Self-supervised speaker verification (closed). Our overall training process is similar to the proposed one from the first place team in the last year's VoxSRC2020 challenge. The main difference is a recently proposed non-contrastive self-supervised method in computer vision (CV), distillation with no labels (DINO), is used to train our initial model, which outperformed the last year's contrastive learning based on momentum contrast (MoCo). Also, this requires only a few iterations in the iterative clustering stage, where pseudo labels for supervised embedding learning are updated based on the clusters of the embeddings generated from a model that is continually fine-tuned over iterations. In the final stage, Res2Net50 is trained on the final pseudo labels from the iterative clustering stage. This is our best submitted model to the challenge, showing 1.89, 6.50, and 6.89 in EER(%) in voxceleb1 test o, VoxSRC-21 validation, and test trials, respectively.
研究动机与目标
- 评估非对比性自监督学习(SSL)在说话人验证中的有效性,特别是使用 DINO 的方法。
- 通过 DINO 预训练提升初始模型质量,从而减少伪标签化流程中所需的迭代聚类步骤数。
- 通过调整段长与边缘参数,优化在大模型上进行鲁棒训练,以应对短语音输入。
- 在预训练阶段不使用说话人标签的前提下,实现在 VoxSRC-21 Track 3 上的最先进性能。
- 通过选择最优训练段长,解决短测试语音(<4 秒)带来的挑战。
提出的方法
- 使用 DINO(一种非对比性 SSL 方法)预训练初始说话人嵌入模型,该方法通过最大化同一样本不同增强视图之间的对齐度,无需负样本挖掘。
- 采用学生-教师蒸馏框架,对教师网络使用指数移动平均更新,并通过中心化与锐化操作防止退化解。
- 利用 DINO 学习到的嵌入进行迭代聚类(k=7500 个聚类),每数个训练周期更新一次伪标签。
- 在 ResNet34 模型上使用添加角边缘(AAM)损失进行训练,将边缘值从 0 逐步增加至 0.3,历时 20 个周期,以优化伪标签嵌入。
- 在最终伪标签上对更大的 Res2Net50 模型进行微调,使用 AAM 损失,并调整段长与边缘超参数以避免对较长训练段的过拟合。
- 在大边缘微调中使用 3 秒长的语音块而非 4 秒长的块,以更好地匹配测试语音的短时长特性。
实验结果
研究问题
- RQ1非对比性自监督学习(DINO)是否能在说话人嵌入学习中超越对比方法(如 MoCo)在说话人验证中的表现?
- RQ2使用 DINO 作为初始预训练方法是否能减少伪标签化流程中所需的迭代聚类步骤数?
- RQ3在大边缘微调阶段选择不同的训练段长,如何影响 VoxSRC-21 中短测试语音的性能表现?
- RQ4在未见测试集上,使用边缘调度策略对更大的模型(Res2Net50)进行微调,是否能提升其在短语音上的泛化能力?
- RQ5DINO 学习到的初始嵌入质量是否优于基于 MoCo 的基线模型,从而带来更好的下游性能?
主要发现
- DINO 预训练在 VoxCeleb1-O 上达到 4.83% 的 EER,优于 MoCo(7.3%),并显著减少了对大规模迭代聚类的需求。
- 迭代聚类阶段仅需 4 次迭代即收敛,VoxCeleb1-O 上 EER 稳定在 2.13%,VoxSRC-21 验证集上为 6.88%。
- 在 Res2Net50 上采用 3 秒语音块与边缘调优的鲁棒训练,实现 VoxCeleb1-O 上 1.91%、VoxSRC-21 验证集上 6.32%、测试集上 6.64% 的 EER。
- 若在大边缘微调中使用 4 秒语音块,测试性能下降至 7.23% EER,表明对较长段落存在过拟合现象。
- 最终系统在 VoxSRC-21 Track 3 上达到最先进性能,最佳提交结果(6.64% EER)在截止日期后提交。
- 使用 DINO 作为初始主干网络显著提升了嵌入质量,实现了更快收敛与在短语音上的更好泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。