Skip to main content
QUICK REVIEW

[论文解读] T-vectors: Weakly Supervised Speaker Identification Using Hierarchical Transformer Model

Yanpei Shi, Mingjie Chen|arXiv (Cornell University)|Oct 29, 2020
Speech Recognition and Synthesis参考文献 20被引用 6
一句话总结

本文提出T-vectors,一种基于层次化Transformer架构并引入记忆机制的模型,用于弱监督多说话人语音中的说话人识别。通过在帧级和段级编码器中利用多头注意力机制及循环记忆连接,该模型在Concat和Overlap场景下,于SWBC-S数据集上相较H-vectors和S-vectors分别实现了13.3%和10.5%的相对性能提升。

ABSTRACT

Identifying multiple speakers without knowing where a speaker's voice is in a recording is a challenging task. This paper proposes a hierarchical network with transformer encoders and memory mechanism to address this problem. The proposed model contains a frame-level encoder and segment-level encoder, both of them make use of the transformer encoder block. The multi-head attention mechanism in the transformer structure could better capture different speaker properties when the input utterance contains multiple speakers. The memory mechanism used in the frame-level encoders can build a recurrent connection that better capture long-term speaker features. The experiments are conducted on artificial datasets based on the Switchboard Cellular part1 (SWBC) and Voxceleb1 datasets. In different data construction scenarios (Concat and Overlap), the proposed model shows better performance comparaing with four strong baselines, reaching 13.3% and 10.5% relative improvement compared with H-vectors and S-vectors. The use of memory mechanism could reach 10.6% and 7.7% relative improvement compared with not using memory mechanism.

研究动机与目标

  • 解决在缺乏精确段级标注的情况下,多说话人语音录音中的说话人识别挑战。
  • 克服先前模型(如H-vectors)因使用GRU导致训练速度慢和梯度消失的局限性。
  • 通过在帧级编码器之间引入记忆机制,提升长期说话人特征建模能力。
  • 利用Transformer的并行处理能力和注意力机制,更有效地捕捉重叠语音中的说话人特异性属性。
  • 仅使用话语级说话人标签实现弱监督,验证模型在大规模数据集上的可扩展性训练能力。

提出的方法

  • 采用层次化架构,包含基于Transformer编码器模块的帧级编码器和段级编码器。
  • 使用正弦位置编码将序列顺序信息注入输入声学特征中。
  • 通过大小为M、步长为H的滑动窗口将输入序列划分为重叠段,并由N个帧级编码器处理。
  • 在帧级编码器之间实现带记忆连接的多头自注意力机制,以在段间保持隐藏状态。
  • 在每个帧级编码器后应用统计池化,并通过两层全连接层和Sigmoid激活函数的最终分类器。
  • 使用二元交叉熵损失进行训练,以话语级说话人标签集合作为监督信号。

实验结果

研究问题

  • RQ1基于Transformer的层次化架构是否能在弱监督说话人识别任务中超越RNN-based模型(如H-vectors)?
  • RQ2帧级编码器之间集成记忆机制对长期说话人表征学习有何影响?
  • RQ3与TDNN相比,Transformer模块中的多头注意力机制在建模重叠说话人特征方面提升了多少?
  • RQ4滑动窗口分割中的窗口大小(M)对模型性能有何影响?
  • RQ5所提出的T-vector模型在不同数据构建场景(Concat与Overlap)及不同说话人数量下是否具备良好的泛化能力?

主要发现

  • 在Concat场景下,T-vector模型相较H-vectors和S-vectors在SWBC-S数据集上分别实现13.3%和10.5%的相对性能提升。
  • 在Overlap场景下,模型相较H-vectors和S-vectors分别实现10.56%和7.7%的相对性能提升。
  • 引入记忆机制后,相较无记忆机制的相同模型,性能分别提升10.6%和7.7%,尤其在长语音中表现更优。
  • 帧级分割的最优窗口大小为25帧,在Concat和Overlap设置下均取得最佳性能。
  • 随着每句话中说话人数量增加,性能下降,其中三说话人条件下的表现最差,主要由于重叠语音的复杂性。
  • 即使在训练数据有限的情况下,模型仍表现出强鲁棒性,表明其适用于大规模弱监督学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。