[论文解读] Semi-supervised Time Domain Target Speaker Extraction with Attention
本文提出 Exformer,一种基于时域 Transformer 的目标说话人分离架构,通过在双路 Transformer 块中结合预训练说话人嵌入器与多头注意力机制,实现高性能目标说话人提取。该模型在监督学习下达到最先进性能,并通过使用无标签混合语音的两阶段半监督训练流程进一步提升性能,在 10% 训练批次包含无标签数据时,相比监督基线实现 0.6 dB 的 SI-SDR 提升。
In this work, we propose Exformer, a time-domain architecture for target speaker extraction. It consists of a pre-trained speaker embedder network and a separator network based on transformer encoder blocks. We study multiple methods to combine speaker information with the input mixture, and the resulting Exformer architecture obtains superior extraction performance compared to prior time-domain networks. Furthermore, we investigate a two-stage procedure to train the model using mixtures without reference signals upon a pre-trained supervised model. Experimental results show that the proposed semi-supervised learning procedure improves the performance of the supervised baselines.
研究动机与目标
- 开发一种时域神经网络用于目标说话人提取(TSE),有效整合说话人嵌入与自注意力机制。
- 研究在基于 Transformer 的分离器中,说话人嵌入与混合表示之间不同融合策略(拼接、逐元素相乘、逐元素相加)的影响。
- 探索一种两阶段半监督训练框架,利用无标签语音混合信号提升 TSE 性能,超越监督基线。
- 评估在半监督设置中使用预训练说话人嵌入器并结合重建损失的有效性。
提出的方法
- Exformer 架构使用基于 BLSTM 的预训练说话人嵌入器,从登记语音中提取固定维度的说话人嵌入。
- 分离网络基于双路 Transformer 块构建,每个块通过多头注意力处理分段混合表示,并通过逐元素相加、逐元素相乘或拼接方式实现说话人嵌入融合。
- 掩码网络通过分段模块、嵌入引导的双路处理以及重叠-相加重建方法估计时频掩码。
- 采用两阶段训练流程:首先在有标签数据上使用负 SI-SDR 损失进行训练;其次在有标签数据与无标签混合信号的组合上进行微调,引入说话人嵌入器重建损失。
- 在第二阶段应用嵌入器损失,以对齐说话人嵌入空间与分离任务,提升在无标签数据上的泛化能力。
- 模型使用缩放学习率调度器进行训练,结合监督数据与伪标签数据,无标签数据比例在不同实验中有所调整。
实验结果
研究问题
- RQ1说话人嵌入融合策略(拼接、逐元素相乘、逐元素相加)的选择如何影响基于 Transformer 的 TSE 系统性能?
- RQ2在无参考信号的情况下,使用无标签语音混合信号时,两阶段半监督训练流程能否提升 TSE 性能?
- RQ3在第二阶段训练中引入说话人嵌入器重建损失是否能增强模型在无标签数据上的泛化能力与性能?
- RQ4在时域 TSE 的半监督训练中,无标签数据与有标签数据的最优比例是多少?
主要发现
- 采用说话人嵌入加法融合的 Exformer 在各类融合方式中表现最佳,监督训练下达到 19.85 dB SI-SDR 与 3.82 PESQ。
- 与乘法融合相比,加法融合使 SI-SDR 提升 0.3 dB;与拼接融合相比,提升 0.8 dB,表明其在引导分离器关注说话人身份方面更为有效。
- 采用 10% 无标签数据比例的两阶段半监督训练流程,相比监督基线(19.85 dB)实现 0.6 dB 的 SI-SDR 提升(达 20.21 dB),PESQ 也略有提升至 3.83。
- 在第二阶段引入嵌入器损失可提升性能,但仅在从监督模型初始化时有效;若随机初始化并使用嵌入器损失,则性能下降。
- 性能在无标签数据采样率为 10% 时达到峰值,进一步提高至 25% 或 50% 时性能下降,可能由于过拟合或伪标签噪声。
- 该模型优于先前的时域 TSE 方法(如 TseNet 与 SpEx+),证实了结合恰当融合机制与半监督学习的 Transformer 架构在性能上的优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。