[论文解读] Triplet Network with Attention for Speaker Diarization
本文提出一种端到端三元组网络,结合自注意力机制用于说话人打标,直接从原始音频学习时序语音表征,而非依赖i-向量。通过联合优化嵌入表示与度量学习(采用三元组损失),该模型在CALLHOME数据集上实现了12.7%的打标错误率(DER),优于基于i-向量的基线方法,包括使用更大训练语料库并微调全连接网络的模型。
In automatic speech processing systems, speaker diarization is a crucial front-end component to separate segments from different speakers. Inspired by the recent success of deep neural networks (DNNs) in semantic inferencing, triplet loss-based architectures have been successfully used for this problem. However, existing work utilizes conventional i-vectors as the input representation and builds simple fully connected networks for metric learning, thus not fully leveraging the modeling power of DNN architectures. This paper investigates the importance of learning effective representations from the sequences directly in metric learning pipelines for speaker diarization. More specifically, we propose to employ attention models to learn embeddings and the metric jointly in an end-to-end fashion. Experiments are conducted on the CALLHOME conversational speech corpus. The diarization results demonstrate that, besides providing a unified model, the proposed approach achieves improved performance when compared against existing approaches.
研究动机与目标
- 为解决基于i-向量的说话人打标系统中特征提取与度量学习解耦的问题,从而降低端到端优化的潜力。
- 探究通过三元组损失联合表示学习与度量学习是否能在不依赖i-向量的情况下提升打标性能。
- 评估自注意力机制在建模序列语音特征以用于说话人嵌入学习方面的有效性。
- 将端到端注意力机制三元组网络与传统i-向量流程及基于i-向量的三元组网络进行比较。
- 证明在有限数据集上训练的小型统一模型可超越在更大语料库上训练的两阶段系统。
提出的方法
- 该模型使用自注意力机制直接从原始音频特征学习说话人嵌入,取代了i-向量提取的需要。
- 在学习到的嵌入上应用三元组损失函数,通过引入边界值,最小化同说话人间的距离,同时最大化不同说话人间的距离。
- 网络在TEDLIUM语料库上进行端到端训练,采用三元组挖掘策略,边界值M=64,三元组边界α=0.8。
- 最终的说话人打标通过x-means估计说话人数量,并在学习到的嵌入上进行k-means聚类完成。
- 使用CALLHOME语料库评估模型性能,采用语音活动区域为已知条件(oracle),并设置250ms的邻接容忍度,以Diapization Error Rate(DER)作为评估指标。
- 该架构将传统的两阶段流程(i-向量提取 + 度量学习)替换为统一的、可端到端训练的系统。
实验结果
研究问题
- RQ1与基于i-向量的流程相比,通过三元组损失实现说话人嵌入与度量学习的端到端学习是否能提升打标性能?
- RQ2将i-向量替换为基于原始音频的注意力网络是否能提升泛化能力,尤其是在训练数据有限的情况下?
- RQ3自注意力机制在建模语音序列中的长距离依赖关系以用于说话人表征学习方面有多高效?
- RQ4在较小数据集上训练的统一模型是否能超越在更大语料库上训练的两阶段系统?
- RQ5嵌入表示与度量学习的联合优化对聚类质量与DER有何影响?
主要发现
- 所提出的端到端注意力三元组网络在CALLHOME语料库上实现了12.7%的打标错误率(DER),优于i-向量 + 余弦(18.7%)和i-向量 + PLDA(17.6%)的基线模型。
- 尽管在更小的语料库(TEDLIUM)上训练,该模型仍优于在更大语料库(GMM-UBM)上训练的i-向量 + 三元组网络(13.4% DER),显示出更强的泛化能力。
- t-SNE可视化结果表明,学习到的嵌入能有效分离不同说话人,同时保持同一说话人类别内部的紧凑性。
- 在开发集上,k-means聚类的NMI达到0.94,纯度达到0.94,表明说话人嵌入的聚类质量很高。
- 消融实验表明,采用较小的三元组边界(α=0.8)和较大的边界值(M=64)可提升训练稳定性和性能。
- 结果表明,联合端到端学习表示与度量学习比顺序处理i-向量与度量学习更有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。