Skip to main content
QUICK REVIEW

[论文解读] Speaker Recognition Based on Deep Learning: An Overview

Zhongxin Bai, Xiao-Lei Zhang|arXiv (Cornell University)|Dec 2, 2020
Speech Recognition and Synthesis参考文献 186被引用 10
一句话总结

本文全面综述了基于深度学习的说话人识别技术,重点涵盖说话人验证、识别、语音分离(diarization)以及鲁棒性识别。文章详细阐述了输入表征、神经网络架构、时序池化方法和损失函数等核心组件,同时调研了端到端语音分离、域自适应和噪声鲁棒性方面的最新进展,为该领域的研究人员提供了基础性参考资源。

ABSTRACT

Speaker recognition is a task of identifying persons from their voices. Recently, deep learning has dramatically revolutionized speaker recognition. However, there is lack of comprehensive reviews on the exciting progress. In this paper, we review several major subtasks of speaker recognition, including speaker verification, identification, diarization, and robust speaker recognition, with a focus on deep-learning-based methods. Because the major advantage of deep learning over conventional methods is its representation ability, which is able to produce highly abstract embedding features from utterances, we first pay close attention to deep-learning-based speaker feature extraction, including the inputs, network structures, temporal pooling strategies, and objective functions respectively, which are the fundamental components of many speaker recognition subtasks. Then, we make an overview of speaker diarization, with an emphasis of recent supervised, end-to-end, and online diarization. Finally, we survey robust speaker recognition from the perspectives of domain adaptation and speech enhancement, which are two major approaches of dealing with domain mismatch and noise problems. Popular and recently released corpora are listed at the end of the paper.

研究动机与目标

  • 提供基于深度学习的说话人识别方法的系统性、最新综述,重点聚焦于超越传统方法的最新进展。
  • 分析说话人嵌入学习的核心组件——输入、网络结构、时序池化和损失函数——在验证与识别任务中的作用。
  • 调研语音分离技术的最新进展,包括监督式、端到端及在线学习范式。
  • 探讨通过域自适应和语音增强实现鲁棒性说话人识别的技术,应对噪声和域不匹配等挑战。
  • 整理并总结常用及近期发布的说话人识别数据集,以供研究参考。

提出的方法

  • 综述混合深度学习架构,如 DNN-UBM/i-vector 和 DNN-BNF/i-vector,用于说话人嵌入提取。
  • 分析不同输入特征(如原始波形、频谱图、MFCC)的作用及其对模型性能的影响。
  • 研究用于说话人嵌入学习的各种深度神经网络架构(如 DNN、CNN、RNN、Transformers)。
  • 比较平均池化、统计池化和基于注意力的聚合等时序池化策略在序列表征中的表现。
  • 调研端到端说话人验证中使用的损失函数,包括三元组损失、对比损失和基于边距的损失,特别关注训练样本的构建方式。
  • 综述端到端语音分离系统,这些系统联合预测说话人切换和身份,包括在线处理和多模态方法。

实验结果

研究问题

  • RQ1基于深度学习的说话人嵌入方法相较于传统 GMM-UBM 和 i-vector 系统在性能上有哪些提升?
  • RQ2哪些关键的架构与训练组件(输入、网络结构、池化方法、损失函数)促成了有效的说话人表征学习?
  • RQ3与传统两阶段方法相比,端到端和在线语音分离系统在哪些方面实现了进步?
  • RQ4域自适应和语音增强技术在多大程度上提升了在噪声或域不匹配条件下的鲁棒性?
  • RQ5哪些是最相关且广泛使用的数据集可用于现代说话人识别系统的训练与评估?

主要发现

  • 深度学习显著提升了说话人识别的性能,在复杂的真实环境中也达到了最先进水平。
  • 采用对比损失或三元组损失的端到端说话人嵌入模型在验证与识别任务中均优于传统两阶段系统。
  • 监督式端到端语音分离系统在处理重叠语音和可变说话人数量方面,性能优于传统流水线方法。
  • 基于对抗训练的域自适应技术展现出潜力,但尚未在性能增益上超越传统的 PLDA 域自适应方法。
  • 语音增强方法,尤其是与深度学习结合时,能有效抑制噪声并提升在噪声环境下的识别准确率。
  • 近期发布的数据集如 DIHARD、AMI、FFSVC20 和 LibriCSS,显著推动了说话人识别系统鲁棒性与真实世界适用性的评估进展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。