[论文解读] Atss-Net: Target Speaker Separation via Attention-based Neural Network
该论文提出 Atss-Net,一种基于注意力机制的神经网络,通过利用自注意力机制建模长距离依赖关系并实现并行计算,在频谱图域中实现目标说话人分离。该模型在 LibriSpeech 数据集上取得了 9.30 dB 的 SDR 最先进性能,优于 VoiceFilter 模型,且参数量减少 50%(468 万 vs. 945 万),并在包含音乐和人声背景等复杂噪声条件下的语音增强任务中表现出强大的泛化能力。
Recently, Convolutional Neural Network (CNN) and Long short-term memory (LSTM) based models have been introduced to deep learning-based target speaker separation. In this paper, we propose an Attention-based neural network (Atss-Net) in the spectrogram domain for the task. It allows the network to compute the correlation between each feature parallelly, and using shallower layers to extract more features, compared with the CNN-LSTM architecture. Experimental results show that our Atss-Net yields better performance than the VoiceFilter, although it only contains half of the parameters. Furthermore, our proposed model also demonstrates promising performance in speech enhancement.
研究动机与目标
- 解决在仅提供目标说话人参考语句的情况下,多说话人、高噪声环境中目标说话人分离的挑战。
- 通过利用注意力机制实现并行处理和降低模型复杂度,克服现有 CNN-LSTM 架构在顺序计算和高参数量方面的局限性。
- 探究将说话人嵌入作为辅助输入是否不仅能提升目标分离性能,还能增强在多样化噪声条件下的通用语音增强性能。
- 评估自注意力模块在建模频谱图中长距离依赖关系方面对分离质量的提升效果。
提出的方法
- 模型在频谱图域中运行,使用二维卷积编码器从混合语音的幅度谱图中提取初始特征。
- 通过与文本无关的说话人验证系统提取目标说话人嵌入,将其复制到所有时间帧,并与编码后的频谱图特征拼接。
- 应用三组时间自注意力模块,每组包含多头注意力(2 个头)和 64 维特征投影,以建模帧间依赖关系并优化表示。
- 注意力机制在时间帧之间计算动态权重,使网络能够聚焦于目标说话人语音的相关段落,同时抑制干扰。
- 最终输出为目标说话人重构的幅度谱图,通过原始相位还原至时域。
- 使用 Adam 优化器进行训练,初始固定学习率为 0.0001,并在验证损失连续 10 个周期未改善时启用早停策略。

实验结果
研究问题
- RQ1基于注意力机制的架构是否能在参数量更少的情况下,优于 CNN-LSTM 模型在目标说话人分离任务中的表现?
- RQ2将说话人嵌入作为辅助输入是否能同时提升目标分离和通用语音增强性能?
- RQ3与循环网络相比,自注意力机制在频谱图中建模长距离依赖关系方面的提升程度如何?
- RQ4当目标说话人存在于背景中(如音乐或演唱)时,该模型在语音增强任务中的表现如何?
主要发现
- 训练后 Atss-Net 的平均 SDR 达到 10.56 dB,相比初始的 1.26 dB 提升了 9.30 dB,优于基线模型 VoiceFilter 的 7.78 dB 提升。
- 尽管仅使用 468 万个参数(约为 VoiceFilter 的 945 万个参数的一半),该模型仍实现了更优的分离性能。
- 消融实验表明,若移除注意力模块,SDR 提升仅达 3.88 dB,证实了注意力机制在性能中的关键作用。
- 采用相同架构但使用排列不变训练(PIT)损失的模型达到 8.57 dB SDR,低于 Atss-Net 的 9.30 dB,表明说话人嵌入引导在本任务中比 PIT 更有效。
- 在 AISHELL-2 的语音增强实验中,Atss-Net 在 20 dB 信噪比下取得 3.22 的 PESQ,优于 VoiceFilter 的 2.62,表明其对人声和音乐噪声具有强鲁棒性。
- 听感样本验证表明,Atss-Net 即使在复杂背景(如演唱和音乐)下也能有效分离目标说话人,支持其强大的泛化能力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。