[论文解读] The DKU-DukeECE System for the Self-Supervision Speaker Verification Task of the 2021 VoxCeleb Speaker Recognition Challenge
本论文介绍了DKU-DukeECE系统在2021年VoxCeleb说话人识别挑战赛中的应用,提出了一种迭代式、多模态自监督框架,通过聚类集成融合音频与视觉伪标签,以提升说话人表征学习效果。该方法在开发集上达到5.58%的EER,在测试集上达到5.59%,证明了迭代伪标签法与跨模态知识蒸馏在自监督说话人验证中的有效性。
This report describes the submission of the DKU-DukeECE team to the self-supervision speaker verification task of the 2021 VoxCeleb Speaker Recognition Challenge (VoxSRC). Our method employs an iterative labeling framework to learn self-supervised speaker representation based on a deep neural network (DNN). The framework starts with training a self-supervision speaker embedding network by maximizing agreement between different segments within an utterance via a contrastive loss. Taking advantage of DNN's ability to learn from data with label noise, we propose to cluster the speaker embedding obtained from the previous speaker network and use the subsequent class assignments as pseudo labels to train a new DNN. Moreover, we iteratively train the speaker network with pseudo labels generated from the previous step to bootstrap the discriminative power of a DNN. Also, visual modal data is incorporated in this self-labeling framework. The visual pseudo label and the audio pseudo label are fused with a cluster ensemble algorithm to generate a robust supervisory signal for representation learning. Our submission achieves an equal error rate (EER) of 5.58% and 5.59% on the challenge development and test set, respectively.
研究动机与目标
- 通过在无标签音视频数据上应用迭代伪标签法,提升自监督说话人验证性能。
- 通过聚类集成算法融合音频与视觉伪标签,增强判别性说话人表征学习。
- 通过迭代优化伪标签,提升模型性能,减少对人工标注的依赖。
- 探索音频与视觉模态在自监督学习中用于说话人验证的互补优势。
- 在VoxSRC 2021自监督说话人验证任务中实现最先进性能。
提出的方法
- 框架首先在音频数据上进行对比自监督学习(CSL),通过增强视图的实例判别方法预训练音频编码器。
- 利用k-means对预训练模型的音频表征进行聚类,生成初始伪标签用于监督训练。
- 基于音频聚类生成的伪标签训练视觉编码器,同时对视觉表征进行聚类,生成视觉伪标签。
- 通过聚类集成算法融合音频与视觉伪标签,构建稳健的联合监督信号以支持表征学习。
- 通过使用前一轮生成的更新伪标签,迭代地优化说话人与人脸表征网络。
- 最终模型采用标签平滑、Squeeze-Excitation模块和AAM-softmax损失进行训练,分数通过自适应对称分数归一化(AS-Norm)进行归一化处理。
实验结果
研究问题
- RQ1使用多模态数据进行迭代伪标签法,是否能超越对比预训练,在自监督说话人表征学习中取得更好效果?
- RQ2通过聚类集成融合音频与视觉伪标签,如何提升说话人验证的鲁棒性与准确性?
- RQ3自监督模型在迭代优化噪声伪标签的过程中,能在多大程度上实现自身判别能力的自我增强?
- RQ4当音频数据有限或存在噪声时,视觉模态对提升说话人嵌入质量有何贡献?
- RQ5与单模态自监督相比,多模态伪标签融合在EER与聚类质量方面表现如何?
主要发现
- 系统在VoxSRC 2021开发集上达到5.58%的等错误率(EER),在测试集上达到5.59%,表现出强大的泛化能力。
- 经过四轮迭代后,音频聚类的NMI达到0.95196,表明伪标签质量高,能有效反映说话人结构。
- 四轮迭代后,视觉聚类的NMI达到0.95462,表明基于音频引导的伪标签可有效学习视觉说话人表征。
- 融合伪标签的NMI达到0.95862,表明聚类集成能有效结合两模态的互补信息。
- 最终融合系统在开发集上经分数归一化后,minDCF为0.315,EER为5.578%;在测试集上EER为5.594%。
- 在最终系统中引入Squeeze-Excitation模块与AAM-softmax损失进一步提升了性能,凸显了架构改进在伪标签数据上的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。