Skip to main content
QUICK REVIEW

[论文解读] Neural Pitch-Shifting and Time-Stretching with Controllable LPCNet

Max Morrison, Zeyu Jin|arXiv (Cornell University)|Oct 5, 2021
Speech and Audio Processing参考文献 26被引用 14
一句话总结

本文提出可控LPCNet(CLPCNet),一种改进的神经声码器,通过增强LPCNet的音高表征、解耦音高与声学特征并扩展训练数据,实现了高保真度、可控的音高变换与时间拉伸。CLPCNet在客观与主观性能上均优于先前的神经与DSP方法,在音高变换与时间拉伸中保持或超越了质量表现,同时支持同步的语音编码与处理。

ABSTRACT

Modifying the pitch and timing of an audio signal are fundamental audio editing operations with applications in speech manipulation, audio-visual synchronization, and singing voice editing and synthesis. Thus far, methods for pitch-shifting and time-stretching that use digital signal processing (DSP) have been favored over deep learning approaches due to their speed and relatively higher quality. However, even existing DSP-based methods for pitch-shifting and time-stretching induce artifacts that degrade audio quality. In this paper, we propose Controllable LPCNet (CLPCNet), an improved LPCNet vocoder capable of pitch-shifting and time-stretching of speech. For objective evaluation, we show that CLPCNet performs pitch-shifting of speech on unseen datasets with high accuracy relative to prior neural methods. For subjective evaluation, we demonstrate that the quality and naturalness of pitch-shifting and time-stretching with CLPCNet on unseen datasets meets or exceeds competitive neural- or DSP-based approaches.

研究动机与目标

  • 为解决现有神经与基于DSP的方法在音高变换与时间拉伸中常引入失真或损害音色的问题。
  • 通过解决三个核心问题提升LPCNet在音高变换中的性能:音高表征不佳、音高与声学特征解耦不足,以及极端音高范围训练数据有限。
  • 实现在未见说话人与数据集上,恒定比与可变比音高变换与时间拉伸的高保真度。
  • 在单一统一框架中实现高质量语音合成与操控,支持实时交互式编辑。
  • 证明神经方法在语音操控任务中可达到或超越成熟DSP工具(如TD-PSOLA与WORLD)的感知质量。

提出的方法

  • 通过引入更鲁棒的音高表征并显式解耦音高与谱特征,提升控制能力并减少失真,从而增强LPCNet。
  • 扩展训练数据以包含极端音高范围(极高与极低),提升在不同说话人与音高变化下的泛化能力。
  • 在采样率网络中移除GRU层的稀疏性约束,以改善自回归生成过程中激励信号的建模。
  • 引入改进的训练流程,避免使用会降低性能的数据增强技术,提升稳定性与准确性。
  • 采用双分支网络架构:帧率网络处理音高、基音周期与BFCC特征,采样率网络自回归地生成mu-law编码的激励样本。
  • 应用源-滤波器分解,分别建模残差(音高与噪声)与谱特征(音色)分量,实现对音高与时长的精确操控。

实验结果

研究问题

  • RQ1神经声码器如LPCNet能否在不牺牲合成质量的前提下,被有效适配用于精确且自然的音高变换与时间拉伸?
  • RQ2音高表征、特征解耦与训练数据分布如何影响神经语音操控的性能?
  • RQ3CLPCNet在音高变换与时间拉伸任务中,是否在客观指标与主观听音测试中均优于成熟的DSP方法(如TD-PSOLA与WORLD)?
  • RQ4CLPCNet能否在未见说话人与数据集上保持高保真度,实现可变比语音操控任务的泛化?
  • RQ5单一神经声码器在多大程度上可同时支持高质量语音编码与可控语音操控?

主要发现

  • 在Ravdess数据集上,CLPCNet在未见说话人的恒定比音高变换(比例1.00)中取得0.945的平均F1分数,显著优于LPCNet(F1 = 0.791),并匹配或超过先前的神经方法。
  • 在客观指标方面,CLPCNet在1.00音高比例下将RMS误差降低至21.6,GPE降低至0.040,相较LPCNet的79.5与0.101,显示出音高精度的显著提升。
  • 在主观MOS测试中,CLPCNet在所有条件下均优于LPCNet,并在大多数音高变换与时间拉伸比例下,自然度与质量匹配或超过WORLD与TD-PSOLA。
  • 在可变比音高变换中,CLPCNet取得4.25的MOS分数,显著优于先前的神经方法,接近原始录音的质量。
  • 消融研究显示,移除稀疏性约束并消除数据增强可显著提升性能,当所有改进均应用时,DAPS上的F1从0.779提升至0.945。
  • CLPCNet在未见说话人与数据集上表现出优越的泛化能力,在VCTK(已见与未见)与Ravdess上均保持一致性能,未见数据在1.00比例下RMS误差低于20.0。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。