Skip to main content
QUICK REVIEW

[论文解读] HLT-NUS Submission for NIST 2019 Multimedia Speaker Recognition Evaluation

Rohan Kumar Das, Ruijie Tao|arXiv (Cornell University)|Oct 8, 2020
Speech and Audio Processing参考文献 40被引用 4
一句话总结

本论文介绍了HLT-NUS为2019年NIST多媒体说话人识别评估开发的多模态说话人识别系统,该系统结合了基于x-vector的音频系统与基于ResNet/InsightFace的视觉系统,并采用评分级融合策略。最终系统在评估集上实现了0.88%的EER和0.026的actDCF,通过评估后优化显著优于挑战赛提交结果。

ABSTRACT

This work describes the speaker verification system developed by Human Language Technology Laboratory, National University of Singapore (HLT-NUS) for 2019 NIST Multimedia Speaker Recognition Evaluation (SRE). The multimedia research has gained attention to a wide range of applications and speaker recognition is no exception to it. In contrast to the previous NIST SREs, the latest edition focuses on a multimedia track to recognize speakers with both audio and visual information. We developed separate systems for audio and visual inputs followed by a score level fusion of the systems from the two modalities to collectively use their information. The audio systems are based on x-vector based speaker embedding, whereas the face recognition systems are based on ResNet and InsightFace based face embeddings. With post evaluation studies and refinements, we obtain an equal error rate (EER) of 0.88% and an actual detection cost function (actDCF) of 0.026 on the evaluation set of 2019 NIST multimedia SRE corpus.

研究动机与目标

  • 开发一种鲁棒的说话人识别系统,能够利用音频与视觉线索,在真实世界、恶劣条件下提升性能。
  • 探究混合带宽音频处理与语音增强(WPE)在噪声或信道变化条件下对说话人识别性能的提升效果。
  • 评估基于深度学习的人脸识别模型(ResNet-101与InsightFace)在多模态说话人验证背景下用于视觉说话人识别的性能表现。
  • 探索最优的评分级融合策略,以整合音频与视觉系统输出,实现优于单模态系统的整体性能。
  • 通过先进模型与校准技术,在评估后对系统进行优化,实现在2019年NIST多媒体SRE基准上的最先进性能。

提出的方法

  • 基于8 kHz(窄带)与16 kHz(宽带)语音数据,开发多个基于x-vector的音频系统,以利用混合带宽优势,提升系统鲁棒性。
  • 应用加权预测误差(WPE)语音增强技术,降低真实世界音频输入中的噪声,提升说话人嵌入提取的特征质量。
  • 训练并评估基于ResNet-101的人脸识别模型,用于视觉说话人嵌入提取,利用深度卷积网络学习具有判别力的面部特征。
  • 开发更先进的基于InsightFace的视觉系统,采用当前最先进的目标检测与人脸识别模型,相比ResNet-101基线模型显著提升准确率。
  • 通过校准后的评分实现音频与视觉系统的评分级融合,整合多个音频与视觉模型的输出,以增强整体检测性能。
  • 对融合系统应用校准技术,以最小化实际检测代价函数(actDCF),优化真实场景部署表现。

实验结果

研究问题

  • RQ1结合窄带与宽带音频处理在恶劣条件下是否能提升说话人识别性能?
  • RQ2通过WPE进行语音增强在噪声或信号退化音频输入上的说话人识别准确率提升程度如何?
  • RQ3在多模态设置下,现代深度人脸识别模型(ResNet-101与InsightFace)在视觉说话人识别中的性能表现如何比较?
  • RQ4音频与视觉系统之间的评分级融合对整体说话人识别性能有何影响?
  • RQ5评估后系统优化(如采用先进模型与校准技术)是否能显著提升性能,超越挑战赛提交结果?

主要发现

  • 最终的音视频融合系统在2019年NIST多媒体SRE评估集上实现了0.88%的等错误率(EER)与0.026的实际检测代价函数(actDCF)。
  • 评估后基于InsightFace的视觉系统实现了1.55%的EER与0.085的actDCF,显著优于基于ResNet-101的视觉系统(EER: 6.16%,actDCF: 0.343)。
  • 经WPE增强的x-vector系统(x-vector_8k-WPE)在评估集上实现了最佳单模态音频性能,EER为7.02%,actDCF为0.529。
  • 评估后音视频融合系统将actDCF从挑战赛提交时的0.136降低至0.026,相对改进达81%。
  • 最终融合系统在性能上与2019年NIST多媒体SRE中排名第一、二的系统相当,证明了多模态融合与评估后优化的有效性。
  • 发现开发集比评估集更具挑战性,因为所有系统在评估集上的表现均优于开发集,表明可能存在领域偏移或数据分布差异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。