[论文解读] Online End-to-End Neural Diarization with Speaker-Tracing Buffer
本文提出一种使用说话人追踪缓存(STB)的在线端到端神经说话人分割系统,以解决跨音频分段中说话人排列不一致的问题,实现低延迟的一致性分割。通过存储并重用先前分段中具有排列信息的帧,并采用可变分段大小进行训练,该方法在CALLHOME数据集上实现12.54%的DER,在CSJ数据集上实现20.77%的DER,实际延迟仅为1.4秒。
This paper proposes a novel online speaker diarization algorithm based on a fully supervised self-attention mechanism (SA-EEND). Online diarization inherently presents a speaker's permutation problem due to the possibility to assign speaker regions incorrectly across the recording. To circumvent this inconsistency, we proposed a speaker-tracing buffer mechanism that selects several input frames representing the speaker permutation information from previous chunks and stores them in a buffer. These buffered frames are stacked with the input frames in the current chunk and fed into a self-attention network. Our method ensures consistent diarization outputs across the buffer and the current chunk by checking the correlation between their corresponding outputs. Additionally, we trained SA-EEND with variable chunk-sizes to mitigate the mismatch between training and inference introduced by the speaker-tracing buffer mechanism. Experimental results, including online SA-EEND and variable chunk-size, achieved DERs of 12.54% for CALLHOME and 20.77% for CSJ with 1.4s actual latency.
研究动机与目标
- 解决在线说话人分割中因分段间说话人分配不一致导致的说话人排列问题。
- 在无需微调的情况下,将预训练的离线SA-EEND模型应用于在线场景。
- 在保持与离线方法相当的分割性能的同时,降低延迟。
- 缓解由于说话人追踪缓存引入的可变输入长度所导致的训练与推理不匹配问题。
提出的方法
- 引入说话人追踪缓存(STB),用于存储先前分段中的代表性帧,以保留说话人排列信息。
- 将缓存帧与当前分段输入拼接,并输入自注意力网络,确保缓存段与当前段的分割输出保持一致。
- 通过对比缓存帧与当前帧输出的相关性,维持说话人一致性。
- 采用可变分段大小训练SA-EEND模型,使训练分布与STB机制引入的可变长度输入保持一致。
- 对STB采用加权采样策略,优先选择携带高排列信息的帧。
- 结合真实与模拟数据集(包括CALLHOME、CSJ以及具有受控重叠率的双说话人录音)进行性能评估。
实验结果
研究问题
- RQ1说话人追踪缓存能否有效解决在线分割中的说话人排列不一致问题?
- RQ2与标准在线分段方法相比,STB机制对分割错误率(DER)有何影响?
- RQ3可变分段大小训练在多大程度上缓解了在线SA-EEND中训练与推理之间的分布不匹配?
- RQ4STB是否能使长音频中的性能接近离线SA-EEND?
- RQ5在不同重叠率和真实场景条件下,系统表现如何?
主要发现
- 所提出的结合STB与可变分段大小训练的在线SA-EEND在CALLHOME数据集上实现12.54%的DER,优于其他在线系统。
- 在CSJ数据集上,该方法实现20.77%的DER,几乎与离线SA-EEND的20.48%性能相当。
- 系统实现1.4秒的实际延迟,表明其具备低延迟特性,适用于实时应用。
- 对于长音频(如CSJ,平均时长767.0秒),STB方法表现出更优性能,表明其在长序列上的可扩展性。
- 可变分段大小训练方案有效缓解了因输入长度不匹配导致的性能下降,尤其在长序列中表现显著。
- 在处理前30秒内,可变分段训练模型初始性能低于固定分段训练模型,但两者在该时间点后均收敛至接近离线性能水平。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。