[论文解读] Self-Supervised Learning from Contrastive Mixtures for Personalized Speech Enhancement
该论文提出了一种对比自监督学习方法,利用噪声语音数据作为伪目标,学习说话人特定的特征,用于个性化语音增强,在仅使用3秒干净语音和原始模型参数量15%的情况下,实现了最先进性能,优于在少样本设置下的说话人无关和非对比自监督基线方法。
This work explores how self-supervised learning can be universally used to discover speaker-specific features towards enabling personalized speech enhancement models. We specifically address the few-shot learning scenario where access to cleaning recordings of a test-time speaker is limited to a few seconds, but noisy recordings of the speaker are abundant. We develop a simple contrastive learning procedure which treats the abundant noisy data as makeshift training targets through pairwise noise injection: the model is pretrained to maximize agreement between pairs of differently deformed identical utterances and to minimize agreement between pairs of similarly deformed nonidentical utterances. Our experiments compare the proposed pretraining approach with two baseline alternatives: speaker-agnostic fully-supervised pretraining, and speaker-specific self-supervised pretraining without contrastive loss terms. Of all three approaches, the proposed method using contrastive mixtures is found to be most robust to model compression (using 85% fewer parameters) and reduced clean speech (requiring only 3 seconds).
研究动机与目标
- 在仅能获取目标说话人少量干净语音(仅数秒)的低数据场景下,实现个性化语音增强。
- 通过利用丰富的噪声语音数据作为伪监督,克服少样本学习在说话人特定语音增强中的局限性。
- 通过在噪声数据上引入对比学习目标,提升模型在模型压缩和有限干净数据下的鲁棒性。
- 探究在未显式使用干净监督的情况下,对混合噪声语音进行对比学习是否能有效发现说话人特定表征。
提出的方法
- 该方法采用对比学习框架,正样本对为同一语音样本的不同噪声变形,负样本对为来自不同说话人的相似变形语音。
- 通过对比损失函数,使模型在预训练阶段最大化正样本对之间的相似性,同时最小化负样本对之间的相似性。
- 训练过程完全依赖噪声语音数据作为伪目标,无需在预训练阶段使用干净参考录音。
- 通过对比同一说话人语音在不同噪声模式下的表现,学习说话人特定的表征。
- 该方法设计为对模型压缩和低资源场景具有鲁棒性,微调阶段仅需3秒干净语音。
实验结果
研究问题
- RQ1噪声语音数据能否有效用作伪目标,在自监督学习中学习说话人特定特征?
- RQ2在少样本语音增强中,对混合噪声语音进行对比学习与说话人无关或非对比自监督预训练相比,表现如何?
- RQ3在模型压缩和有限干净数据条件下,该方法的性能能保持到何种程度?
- RQ4对比目标是否能提升个性化语音增强中的泛化能力和鲁棒性?
主要发现
- 所提出的对比混合方法在模型压缩鲁棒性方面,优于说话人无关的全监督预训练和无对比损失的说话人特定自监督预训练方法。
- 该方法仅需3秒干净语音即可实现优异性能,展现出强大的少样本泛化能力。
- 即使模型参数量减少至原始参数量的15%,性能仍保持高水平,表明对压缩具有强鲁棒性。
- 对比目标显著提升了说话人特定表征与噪声输入模式之间的对齐,增强了个性化效果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。