[论文解读] The SJTU X-LANCE Lab System for CNSRC 2022
本论文介绍了上海交通大学 X-LANCE 实验室在 CNSRC 2022 说话人验证与检索挑战赛中提出的系统,提出了一种基于 ResNet 架构的更深层次残差网络变体(Deeper r-vector)。该系统在未使用外部数据的情况下,通过数据增强、自适应得分归一化及模型集成融合,在 CN-Celeb 数据集上实现了最先进性能,说话人验证的 minDCF 为 0.2975,说话人检索的 mAP 为 0.4626。
This technical report describes the SJTU X-LANCE Lab system for the three tracks in CNSRC 2022. In this challenge, we explored the speaker embedding modeling ability of deep ResNet (Deeper r-vector). All the systems are only trained on the Cnceleb training set and we use the same systems for the three tracks in CNSRC 2022. In this challenge, our system ranks the first place in the fixed track of speaker verification task. Our best single system and fusion system achieve 0.3164 and 0.2975 minDCF respectively. Besides, we submit the result of ResNet221 to the speaker retrieval track and achieve 0.4626 mAP. More importantly, we have helped the wespeaker [1] toolkit reproduce our result: https://github.com/wenet-e2e/wespeaker.
研究动机与目标
- 使用 CN-Celeb 训练集开发一个鲁棒的说话人嵌入系统,以应对 CNSRC 2022 挑战赛。
- 探究加深 r-vector 架构对提升说话人验证与检索性能的有效性。
- 评估数据增强技术(包括噪声、混响和速度扰动)对模型泛化能力的影响。
- 优化评分策略,包括嵌入平均与自适应得分归一化,以提升 minDCF 与 EER。
- 通过统一的系统架构,在 CNSRC 2022 的全部三个赛道中实现最先进性能。
提出的方法
- 系统采用 34 层 r-vector 主干网络,输入为 80 维 fbank 特征,并通过统计池化生成固定长度嵌入。
- 通过在残差块中增加深度(最高达 221 层与 293 层),并使用 1x1、3x3 和 1x1 卷积及步长调整,提出一种更深的残差网络变体 Deeper r-vector。
- 在线应用数据增强,每样本有 60% 概率被增强,包括加性噪声(MUSAN)、混响(RIR 数据集)和速度扰动(0.9x 与 1.1x)。
- 训练流程分为两个阶段:第一阶段使用速度扰动数据与 margin 0.2 进行 AAM 损失训练;第二阶段使用 margin 0.5 与 6 秒语音段进行大 margin 微调。
- 评分采用余弦相似度,并结合自适应得分归一化,采用三种策略处理多条注册语音:Utt-Concat、Emb-Avg 与 Score-Avg,最终结果选用 Emb-Avg 与 ASnorm。
- 在融合策略中,将多个经过大 margin 微调的系统(如 ResNet221、ResNet293 等)进行集成,以提升泛化能力并降低 minDCF。
实验结果
研究问题
- RQ1加深 r-vector 架构对 CN-Celeb 数据集上说话人验证与检索性能有何影响?
- RQ2在线数据增强(噪声、混响、速度扰动)对模型鲁棒性与泛化能力有何影响?
- RQ3在多条注册语音的说话人验证任务中,哪种评分策略——Utt-Concat、Emb-Avg 或 Score-Avg——表现最佳?
- RQ4自适应得分归一化与大 margin 微调是否能进一步提升 minDCF 与 EER,超越标准训练方法?
- RQ5模型集成融合在多个深度 ResNet 变体上是否能有效降低 minDCF?
主要发现
- 221 层的 Deeper r-vector 系统在说话人验证任务中表现最佳,minDCF 达到 0.3164,EER 为 5.227%。
- 多个系统经大 margin 微调后的集成融合,实现了最低的 minDCF 0.2975,优于所有单个系统。
- Emb-Avg 评分策略结合自适应得分归一化表现最佳,第一阶段 minDCF 降至 0.3707,最终系统 minDCF 为 0.3164。
- ResNet221+LM 系统在说话人检索赛道中达到 0.4626 mAP,展现出强大的检索能力。
- 在初始 AAM 训练后进行大 margin 微调,显著提升了所有模型的 minDCF 与 EER,其中 ResNet293+LM 达到最低 EER 5.227%。
- 系统在不依赖外部数据的情况下保持了强大性能,完全依赖 CN-Celeb 训练集与高效的数据增强技术。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。