[论文解读] Royalflush Speaker Diarization System for ICASSP 2022 Multi-channel Multi-party Meeting Transcription Challenge
本论文介绍了在 ICASSP 2022 M2MeT 挑战赛中使用的 Royalflush 说话人打标系统,提出了基于多通道 U-Net 的重叠语音检测模型、基于语音分离与验证的重叠语音处理方法,以及三种说话人嵌入架构。该系统在远场 Alimeeting 评估集上实现了 6.30% 的打标错误率(DER),相较于基线系统的 15.25% 显著降低至最佳单个系统 6.40% 的 DER,并通过集成融合进一步提升性能。
This paper describes the Royalflush speaker diarization system submitted to the Multi-channel Multi-party Meeting Transcription Challenge(M2MeT). Our system comprises speech enhancement, overlapped speech detection, speaker embedding extraction, speaker clustering, speech separation and system fusion. In this system, we made three contributions. First, we propose an architecture of combining the multi-channel and U-Net-based models, aiming at utilizing the benefits of these two individual architectures, for far-field overlapped speech detection. Second, in order to use overlapped speech detection model to help speaker diarization, a speech separation based overlapped speech handling approach, in which the speaker verification technique is further applied, is proposed. Third, we explore three speaker embedding methods, and obtained the state-of-the-art performance on the CNCeleb-E test set. With these proposals, our best individual system significantly reduces DER from 15.25% to 6.40%, and the fusion of four systems finally achieves a DER of 6.30% on the far-field Alimeeting evaluation set.
研究动机与目标
- 在具有重叠语音、噪声和混响的挑战性远场多人会议场景中提升说话人打标性能。
- 开发一种鲁棒的重叠语音检测(OSD)模型,利用多通道音频和 U-Net 架构,以在恶劣声学条件下提升检测性能。
- 通过将语音分离与说话人验证相结合,提升重叠语音段的打标准确性。
- 在 CNCeleb-E 测试集上评估并比较多种最先进说话人嵌入模型,以实现最优性能。
- 通过融合多种具有不同架构和处理策略的子系统,实现在 M2MeT 挑战赛中的顶尖性能。
提出的方法
- 提出一种基于多通道 U-Net 的架构用于远场重叠语音检测,结合 8 通道麦克风阵列的空间多样性与 U-Net 的 U 形编码器-解码器结构,实现精确的帧级分割。
- 通过多通道 WPE 预处理结合 DAS 波束成形进行语音增强,生成单通道清晰信号用于后续处理,但 OSD 模块使用原始多通道输入,未包含此处理。
- 重叠语音段通过两种方法处理:一种启发式方法分配最接近的两个说话人标签;另一种基于语音分离的方法,使用 Conv-Tasnet 分离混合信号,随后通过说话人嵌入中心点的余弦相似度进行说话人验证。
- 在 CNCeleb 数据集上训练并评估三种不同的说话人嵌入模型,采用 MUSAN 和 RIR 进行数据增强,并通过 sox 进行速度扰动。
- 使用 DOVER-Lap 工具包进行系统融合,结合四个在说话人嵌入模型和重叠语音处理策略上各不相同的子系统输出。
- 最终系统在远场 Alimeeting 数据集上进行训练和评估,语音分离数据通过在 SNR 介于 -5 dB 至 5 dB 之间混合来自不同说话人的两个随机语音段模拟生成。
实验结果
研究问题
- RQ1基于多通道 U-Net 的架构是否能在远场多人会议中检测重叠语音方面优于传统模型?
- RQ2与启发式标注相比,将语音分离与说话人验证相结合是否能提升重叠语音区域的打标准确性?
- RQ3哪种说话人嵌入模型架构在 CNCeleb-E 评估集上表现最佳?
- RQ4通过融合多个具有不同组件的子系统,能在多大程度上降低整体说话人打标错误率(DER)?
- RQ5与基线系统相比,所提出的系统在远场 Alimeeting 评估集上的 DER 表现如何?
主要发现
- 最佳单个系统将远场 Alimeeting 评估集上的说话人打标错误率(DER)从基线的 15.25% 降低至 6.40%。
- 使用 DOVER-Lap 融合四个子系统后,最终 DER 达到 6.30%,证明了集成学习的有效性。
- 基于语音分离的重叠语音处理方法相比启发式方法将 DER 降低了近 1% 的绝对值。
- 所提出的多通道 U-Net 基于 OSD 模型通过利用多通道输入的时空与频谱特征,在远场条件下显著提升了检测性能。
- 在评估的三种说话人嵌入模型中,最鲁棒的架构在 CNCeleb-E 测试集上实现了最先进性能。
- 通过 WPE 和 DAS 波束成形进行语音增强显著提升了说话人聚类和语音分离性能,但对 OSD 产生负面影响,因此未包含在 OSD 流程中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。