[论文解读] Multi-stage Speaker Extraction with Utterance and Frame-Level Reference Signals
该论文提出 SpEx++,一种多阶段说话人分离模型,通过同时利用话语级和帧级说话人嵌入作为参考信号,提升在短时参考语音条件下的性能。通过迭代地利用提取的语音作为第二参考信号来优化说话人表征,并采用可学习权重融合多尺度输出,SpEx++ 在 WSJ0-2mix 和噪声基准数据集(WHAM!、WHAMR!)上实现了最先进性能,即使仅使用 2 秒参考样本,其 SI-SDRi 性能也优于先前方法最高达 1.0 dB。
Speaker extraction requires a sample speech from the target speaker as the reference. However, enrolling a speaker with a long speech is not practical. We propose a speaker extraction technique, that performs in multiple stages to take full advantage of short reference speech sample. The extracted speech in early stages is used as the reference speech for late stages. For the first time, we use frame-level sequential speech embedding as the reference for target speaker. This is a departure from the traditional utterance-based speaker embedding reference. In addition, a signal fusion scheme is proposed to combine the decoded signals in multiple scales with automatically learned weights. Experiments on WSJ0-2mix and its noisy versions (WHAM! and WHAMR!) show that SpEx++ consistently outperforms other state-of-the-art baselines.
研究动机与目标
- 解决仅提供短时参考语音时说话人分离性能不佳的挑战。
- 克服单阶段模型仅依赖话语级说话人嵌入作为参考的局限性。
- 提升在噪声和混响环境中说话人分离的鲁棒性与性能,这些环境下的分离任务尤为困难。
- 设计一种信号融合机制,自动组合多尺度输出以提升最终语音质量。
- 证明利用提取语音作为第二参考信号进行迭代优化,可显著提升性能,且无需更长的参考输入。
提出的方法
- 提出一种多阶段架构,其中每一阶段均使用前一阶段提取的目标语音作为新的参考信号。
- 引入帧级序列语音嵌入作为第二参考信号,捕捉目标说话人语音的时序动态特性。
- 采用信号融合策略,通过可学习权重组合多尺度解码输出,生成更高质量的最终输出。
- 使用共享权重的双分支语音编码器,将混合语音和参考语音映射到同一潜在空间。
- 应用说话人提取器,结合话语级与帧级嵌入,估计各尺度特定的掩码以实现目标语音重建。
- 采用多任务损失函数进行模型训练,结合交叉熵损失用于说话人预测与多尺度 SI-SDR 损失用于信号重建。
实验结果
研究问题
- RQ1当仅提供短时参考语音时,多阶段说话人分离框架是否能提升性能?
- RQ2与仅使用话语级嵌入相比,引入帧级序列说话人嵌入作为参考信号是否能带来更好的分离性能?
- RQ3利用早期阶段提取的语音作为第二参考信号,是否能增强说话人表征学习?
- RQ4可学习的信号融合机制在组合多尺度输出以提升语音质量方面是否有效?
- RQ5所提方法是否能在无需特定条件微调的情况下,良好泛化至噪声和混响环境?
主要发现
- 当仅使用 2 秒参考语音时,SpEx++ 相较于 SpEx+ 基线模型,SI-SDRi 提升 1.0 dB,表明在极短参考输入下仍具备强大性能。
- 2 阶段的 SpEx++ 在 SDRi 和 SI-SDRi 上相比 1 阶段的 SpEx+ 提升 0.3 dB,得益于帧级说话人嵌入与信号融合机制的引入。
- 采用可学习权重的信号融合策略(w1=1.18, w2=0.32, w3=0.11)通过更重视高分辨率信号,显著提升性能。
- 在 WHAM! 和 WHAMR! 数据集上,SpEx++ 分别在噪声和混响条件下相较 SpEx+ 实现 0.9 dB 和 0.5 dB 的绝对 SI-SDRi 提升。
- 在四种条件(干净、噪声、混响、噪声-混响)上联合训练的通用 SpEx++ 模型具备良好泛化能力,在噪声、混响和噪声-混响混合语音中分别达到 14.6 dB、11.2 dB 和 11.6 dB 的 SI-SDRi。
- 3 阶段版本相较 2 阶段版本仅带来微小性能提升,表明在两阶段后信息重叠(来自话语级与帧级参考)导致收益递减。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。