[论文解读] End-to-End Speaker Diarization for an Unknown Number of Speakers with Encoder-Decoder Based Attractors
该论文提出了一种基于编码器-解码器的吸引子(EDA),一种新颖的端到端说话人分割方法,能够从语音嵌入中动态确定灵活数量的吸引子,从而在无需预先知道说话人数量的情况下实现精确的分割。该方法在双说话人模拟混合语音中实现了2.69%的最先进分割错误率(DER),在CALLHOME数据集上未知说话人数量时达到了15.29%的DER,优于基线的SA-EEND模型和x-vector聚类方法。
End-to-end speaker diarization for an unknown number of speakers is addressed in this paper. Recently proposed end-to-end speaker diarization outperformed conventional clustering-based speaker diarization, but it has one drawback: it is less flexible in terms of the number of speakers. This paper proposes a method for encoder-decoder based attractor calculation (EDA), which first generates a flexible number of attractors from a speech embedding sequence. Then, the generated multiple attractors are multiplied by the speech embedding sequence to produce the same number of speaker activities. The speech embedding sequence is extracted using the conventional self-attentive end-to-end neural speaker diarization (SA-EEND) network. In a two-speaker condition, our method achieved a 2.69 % diarization error rate (DER) on simulated mixtures and a 8.07 % DER on the two-speaker subset of CALLHOME, while vanilla SA-EEND attained 4.56 % and 9.54 %, respectively. In unknown numbers of speakers conditions, our method attained a 15.29 % DER on CALLHOME, while the x-vector-based clustering method achieved a 19.43 % DER.
研究动机与目标
- 解决端到端说话人分割模型需要预定义最大说话人数量的局限性。
- 实现在未知或可变说话人数量下无需依赖聚类启发式方法的端到端分割。
- 提升在存在语音重叠和可变说话人数量的真实录音中的鲁棒性和性能。
- 开发一种能够从语音嵌入端到端生成吸引子的方法,而无需事先知道说话人数量。
提出的方法
- EDA模块使用编码器-解码器架构,直接从语音嵌入序列中生成灵活数量的吸引子。
- 通过可学习的查询机制对嵌入序列进行注意力计算,实现对说话人表征的动态选择。
- 通过每个吸引子与输入嵌入之间的点积计算说话人活动,生成每个说话人的激活图。
- 将该方法集成到自注意力端到端神经分割(SA-EEND)框架中,保持端到端训练与排列不变训练(PIT)机制。
- 在真实数据(如CALLHOME)上进行微调,并在固定和可变说话人数量条件下进行评估。
- 该方法通过允许多个吸引子在重叠时间帧同时激活,自然地处理说话人重叠。
实验结果
研究问题
- RQ1端到端分割系统能否在无需事先知道说话人数量的情况下动态确定说话人数量?
- RQ2在未知或可变说话人数量场景下,基于吸引子的方法与基于聚类的基线方法相比性能如何?
- RQ3所提出的EDA模块是否能在不重新训练或重新配置的情况下泛化到不同说话人数量?
- RQ4将EDA集成到SA-EEND中是否能提升在模拟和真实世界录音中存在语音重叠的分割准确率?
- RQ5当实际说话人数量作为已知信息(oracle)提供时,模型性能与模型估计的说话人数量相比如何?
主要发现
- 在双说话人模拟混合语音中,所提方法实现了2.69%的分割错误率(DER),优于基线SA-EEND(4.56%)和x-vector聚类方法(7.74%)。
- 在CALLHOME的双说话人子集上,该方法实现了8.07%的DER,优于SA-EEND的9.54%和x-vector聚类的15.45%。
- 在CALLHOME中未知说话人数量的条件下,该方法实现了15.29%的DER,优于x-vector聚类(19.43%),并表现出对说话人数量变化的强鲁棒性。
- 当实际说话人数量作为oracle信息提供时,该方法在CALLHOME上实现了15.43%的DER,与估计说话人数量相比性能下降极小。
- 在DIHARD 2019评估集上,该方法实现了32.59%的DER,优于基线(40.86%)和2019年前最佳系统(35.10%),但尚未达到2019年后最佳系统水平。
- 该方法表现出强大的泛化能力:在灵活说话人数量的模拟混合语音中,其性能仅比专用的双人和三人模型分别下降1.64和0.56个百分点。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。