[论文解读] Deep Extractor Network for Target Speaker Recovery From Single Channel Speech Mixtures
该论文提出了一种深度提取器网络(DENet),通过使用极短的锚定语音(不足1秒)从单通道混合语音中恢复高质量目标说话人语音。通过学习一个稳定的规范嵌入空间以编码相对说话人信息,DENet在SDR和PESQ上分别优于基线模型5.2%和6.6%,并且在多于一个干扰说话人的混合语音中表现出良好的泛化能力。
Speaker-aware source separation methods are promising workarounds for major difficulties such as arbitrary source permutation and unknown number of sources. However, it remains challenging to achieve satisfying performance provided a very short available target speaker utterance (anchor). Here we present a novel "deep extractor network" which creates an extractor point for the target speaker in a canonical high dimensional embedding space, and pulls together the time-frequency bins corresponding to the target speaker. The proposed model is different from prior works in that the canonical embedding space encodes knowledges of both the anchor and the mixture during an end-to-end training phase: First, embeddings for the anchor and mixture speech are separately constructed in a primary embedding space, and then combined as an input to feed-forward layers to transform to a canonical embedding space which we discover more stable than the primary one. Experimental results show that given a very short utterance, the proposed model can efficiently recover high quality target speech from a mixture, which outperforms various baseline models, with 5.2% and 6.6% relative improvements in SDR and PESQ respectively compared with a baseline oracle deep attracor model. Meanwhile, we show it can be generalized well to more than one interfering speaker.
研究动机与目标
- 解决在极短适应语音(如不足1秒)条件下,从单通道语音混合中提取目标说话人语音的挑战。
- 克服现有说话人感知模型的局限性,这些模型通常需要较长的适应段(例如约10秒)。
- 通过引入编码相对说话人信息的规范嵌入空间,提升说话人嵌入空间的稳定性和性能。
- 在不重新训练的情况下,实现对多于一个干扰说话人的混合语音的有效泛化。
- 开发一个统一框架,支持通过反馈机制实现未来无需说话人依赖的锚定学习。
提出的方法
- 使用共享编码器网络为锚定语音和混合语音分别构建主嵌入。
- 通过前馈网络将锚定和混合语音嵌入结合,形成一个规范的高维嵌入空间。
- 在规范空间中学习一个稳定的、基于相对信息的提取器点,以吸引目标说话人的时间-频率单元。
- 使用可微分损失函数最小化预测与真实目标语音之间的重建误差,支持端到端训练。
- 借鉴人类听觉感知的注意力控制原理,指导提取器的形成。
- 使用监督混合标签和锚定语音进行端到端训练,使模型能够稳健泛化到未见过的说话人数量。
实验结果
研究问题
- RQ1深度学习模型能否仅使用不足1秒的锚定语音,从单通道混合语音中实现高质量的目标说话人语音提取?
- RQ2在规范嵌入空间中学习相对说话人信息,是否能产生比绝对嵌入更稳定、更具泛化能力的说话人表征?
- RQ3与现有说话人感知基线模型(如DANet和理想模型)相比,所提出的DENet在SDR和PESQ指标上的表现如何?
- RQ4尽管仅在双说话人混合语音上进行训练,该模型是否能有效泛化到多于一个干扰说话人的混合场景?
- RQ5通过注意力反馈机制,是否可行将DENet框架扩展为支持无需说话人依赖的锚定学习?
主要发现
- 与基线理想深度吸引器模型相比,DENet在SDR上实现5.2%的相对提升,在PESQ上实现6.6%的相对提升。
- 即使锚定语音短于1秒,模型仍能成功恢复高质量目标说话人语音,显著减少了所需的适应时长。
- 规范嵌入空间的稳定性优于主嵌入空间,表现为说话人提取器聚类紧密且彼此分离清晰。
- 在三说话人混合场景中,DENet优于所有基线模型,在中等干扰条件下实现13.44 dB的SDR和2.52的PESQ。
- DENet在恶劣干扰条件下表现出稳健的泛化能力,SDR仅比中等条件下降20%,优于所有基线模型。
- 可视化结果证实,目标说话人嵌入紧密聚集在规范提取器周围,而干扰者嵌入则保持较远距离,验证了模型注意力机制的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。