Skip to main content
QUICK REVIEW

[论文解读] TitaNet: Neural Model for speaker representation with 1D Depth-wise separable convolutions and global context

Nithin Rao Koluguri, Taejin Park|arXiv (Cornell University)|Oct 8, 2021
Speech Recognition and Synthesis被引用 4
一句话总结

TitaNet 是一种轻量级、可扩展的说话人表征神经网络,采用一维深度可分离卷积结合挤压-激励(SE)模块与通道注意力池化,从可变长度语音中提取固定长度的 t-向量。其在 VoxCeleb1 上实现 0.68% 的 EER,在 CH109 上实现 1.11% 的 DER,达到当前最优性能;小型 TitaNet-S 变体(600 万个参数)以极低的计算成本实现接近 SOTA 的结果。

ABSTRACT

In this paper, we propose TitaNet, a novel neural network architecture for extracting speaker representations. We employ 1D depth-wise separable convolutions with Squeeze-and-Excitation (SE) layers with global context followed by channel attention based statistics pooling layer to map variable-length utterances to a fixed-length embedding (t-vector). TitaNet is a scalable architecture and achieves state-of-the-art performance on speaker verification task with an equal error rate (EER) of 0.68% on the VoxCeleb1 trial file and also on speaker diarization tasks with diarization error rate (DER) of 1.73% on AMI-MixHeadset, 1.99% on AMI-Lapel and 1.11% on CH109. Furthermore, we investigate various sizes of TitaNet and present a light TitaNet-S model with only 6M parameters that achieve near state-of-the-art results in diarization tasks.

研究动机与目标

  • 开发一种可扩展、高效的神经网络用于说话人表征学习,使其在说话人验证与分割任务中优于现有模型。
  • 通过在说话人嵌入架构中集成挤压-激励(SE)模块与全局平均池化,利用全局上下文信息,提升表征质量。
  • 通过使用深度可分离卷积与宽度缩放,减小模型规模而不损失性能,实现低资源环境下的部署。
  • 通过端到端训练结合角度 softmax 损失与余弦相似度作为后端,消除对 PLDA 或 AHC 等外部模型的依赖。

提出的方法

  • 模型采用一维深度可分离卷积,以减少参数量,同时保持局部特征提取能力。
  • 在每个残差块之后应用挤压-激励(SE)模块,通过全局平均池化计算全局上下文向量,以重新校准通道维度的特征响应。
  • 基于通道注意力的统计池化层通过学习到的注意力权重,对时间分布特征在通道维度上聚合,生成语音样本级别的嵌入表示。
  • 网络架构基于 ContextNet,包含一个前导模块、多个巨型模块(每个包含重复的深度可分离卷积与逐点卷积)以及一个后置模块,所有模块均带有残差连接。
  • 通过控制重复子模块数量(R)与滤波器通道数(C),实现对模型深度与宽度的灵活调节,便于扩展。
  • 采用角度 softmax 余弦边界损失进行端到端训练,推理阶段使用余弦相似度进行说话人比对。
Fig. 1 : TitaNet Encoder and Decoder Architecture
Fig. 1 : TitaNet Encoder and Decoder Architecture

实验结果

研究问题

  • RQ1与标准 TDNN 或全连接卷积层相比,结合全局上下文建模的一维深度可分离卷积是否能提升说话人嵌入的质量?
  • RQ2将挤压-激励模块与全局平均池化结合,是否能通过捕捉长程依赖关系提升说话人表征?
  • RQ3仅含 600 万个参数的小型 TitaNet-S 模型能否在说话人分割任务中实现接近 SOTA 的性能?
  • RQ4采用角度 softmax 损失进行端到端训练,在多大程度上可消除说话人验证与分割流程中对 PLDA 或 AHC 等外部模型的依赖?
  • RQ5在说话人表征学习中,模型缩放(宽度 vs. 深度)如何影响性能与参数效率?

主要发现

  • TitaNet-L 在 VoxCeleb1 清洗测试集上实现 SOTA 等错误率(EER)0.68%,优于先前模型。
  • TitaNet-M 参数量仅为 ECAPA-TDNN 的一半,在 AMI-MixHeadset 上 DER 为 1.73%,在 AMI-Lapel 上为 1.99%,在 CH109 上为 1.11%。
  • 小型 TitaNet-S 模型(600 万个参数)在 NIST-SRE-2000 上实现 DER 1.42%,在 AMI-MixHeadset 上为 1.97%,展现出优异的效率-精度权衡。
  • 模型在缩小规模时性能下降极小——尽管 TitaNet-S 与 TitaNet-M 的参数量分别减少 2 倍与 4 倍,其 DER 差异微小。
  • TitaNet 在所有分割数据集上均优于 x-vector 与 ECAPA-TDNN 基线模型,包括在 NME-SC 聚类设置下的未知说话人数量场景。
  • 通过端到端训练结合角度 softmax 损失与余弦相似度,TitaNet 消除了对 PLDA 或 AHC 等外部模型的依赖,简化了系统流程。
Fig. 2 : DET curve for VoxCeleb1 cleaned trial comparing with previous studies
Fig. 2 : DET curve for VoxCeleb1 cleaned trial comparing with previous studies

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。