[论文解读] Neural Vocoder is All You Need for Speech Super-resolution
该论文提出NVSR,一种基于神经声码器的语音超分辨率方法,通过利用预训练声码器的先验知识,在多种输入分辨率和上采样率下实现了最先进性能。即使仅采用简单的复制填充法扩展梅尔频带,其在44.1 kHz下的谱距对数距离(LSD)性能仍优于SOTA方法WSRGlow和Nu-wave 8%和37%,充分体现了声码器归纳偏置的关键作用。
Speech super-resolution (SR) is a task to increase speech sampling rate by generating high-frequency components. Existing speech SR methods are trained in constrained experimental settings, such as a fixed upsampling ratio. These strong constraints can potentially lead to poor generalization ability in mismatched real-world cases. In this paper, we propose a neural vocoder based speech super-resolution method (NVSR) that can handle a variety of input resolution and upsampling ratios. NVSR consists of a mel-bandwidth extension module, a neural vocoder module, and a post-processing module. Our proposed system achieves state-of-the-art results on the VCTK multi-speaker benchmark. On 44.1 kHz target resolution, NVSR outperforms WSRGlow and Nu-wave by 8% and 37% respectively on log spectral distance and achieves a significantly better perceptual quality. We also demonstrate that prior knowledge in the pre-trained vocoder is crucial for speech SR by performing mel-bandwidth extension with a simple replication-padding method. Samples can be found in https://haoheliu.github.io/nvsr.
研究动机与目标
- 解决现有语音超分辨率方法受限于固定输入分辨率和上采样率的局限性。
- 提升在真实世界中输入与目标采样率不匹配场景下的泛化能力。
- 探究预训练神经声码器是否可作为语音超分辨率的强归纳偏置。
- 开发一种统一、灵活的系统,无需微调即可处理多说话人、多分辨率的语音超分辨率任务。
提出的方法
- NVSR采用两阶段流程:首先从低分辨率输入预测高分辨率梅尔频谱图,然后通过神经声码器合成波形。
- 梅尔频带扩展采用简单的复制填充方法,出人意料地优于学习型方法。
- 通过低通滤波(LFR)后处理模块对合成波形进行优化,以降低高频噪声。
- 系统利用预训练神经声码器(如TFGAN)注入强语音先验,例如音素结构和谐波模式。
- 方法基于梅尔频率域进行建模,相比线性频率预测,在高上采样率下更具可操作性。
- 同一模型在多种输入分辨率(2–32 kHz)和目标采样率(16–44.1 kHz)下进行评估,展现出高度灵活性。
实验结果
研究问题
- RQ1基于神经声码器的方法能否在语音超分辨率中泛化至多样化的输入采样率和上采样率?
- RQ2与神经网络学习方法相比,简单的复制填充法在梅尔频带扩展中效果如何?
- RQ3预训练声码器先验知识在多大程度上提升了语音超分辨率性能?
- RQ4单一统一模型能否超越为固定输入-目标配置专门训练的任务特定模型?
- RQ5后处理是否显著提升了基于神经声码器的超分辨率波形质量?
主要发现
- NVSR在44.1 kHz目标基准上实现了SOTA平均谱距对数距离(LSD)0.86,优于WSRGlow(0.94)和Nu-wave(1.37)0.08和0.51。
- NVSR-Pad仅使用复制填充法进行梅尔频带扩展,LSD达1.27,优于Nu-wave在12 kHz和24 kHz输入下的表现。
- NVSR在2 kHz至16 kHz超分辨率任务中实现LSD 1.07,是首个在如此高上采样率(UPR = 8)下达成此性能的方法。
- NVSR在无后处理时LSD从0.84下降至0.96,表明后处理在噪声抑制中起关键作用。
- 即使不使用梅尔频谱图预测头,仅声码器本身即可将LSD从原始信号的4.65降至1.89,证明声码器本身具备显著提升语音质量的能力。
- 当使用真实梅尔频谱图时,NVSR性能接近理论最优值(LSD = 0.76),表明梅尔频谱预测模块极为高效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。