Skip to main content
QUICK REVIEW

[论文解读] VoiceFixer: A Unified Framework for High-Fidelity Speech Restoration

Haohe Liu, Xubo Liu|arXiv (Cornell University)|Apr 12, 2022
Speech and Audio Processing参考文献 32被引用 6
一句话总结

VoiceFixer 是一种统一的深度学习框架,用于高保真语音恢复,通过两阶段方法联合处理多种失真(如噪声、混响、削波和低带宽退化):首先估计梅尔频谱图,然后通过神经声码器进行波形合成。其平均意见得分(MOS)比基线方法高出 0.256,且在感知质量方面达到近乎“近似参考”(near-oracle)的性能,即使在严重退化的历史录音中也能实现有效恢复。

ABSTRACT

Speech restoration aims to remove distortions in speech signals. Prior methods mainly focus on a single type of distortion, such as speech denoising or dereverberation. However, speech signals can be degraded by several different distortions simultaneously in the real world. It is thus important to extend speech restoration models to deal with multiple distortions. In this paper, we introduce VoiceFixer, a unified framework for high-fidelity speech restoration. VoiceFixer restores speech from multiple distortions (e.g., noise, reverberation, and clipping) and can expand degraded speech (e.g., noisy speech) with a low bandwidth to 44.1 kHz full-bandwidth high-fidelity speech. We design VoiceFixer based on (1) an analysis stage that predicts intermediate-level features from the degraded speech, and (2) a synthesis stage that generates waveform using a neural vocoder. Both objective and subjective evaluations show that VoiceFixer is effective on severely degraded speech, such as real-world historical speech recordings. Samples of VoiceFixer are available at https://haoheliu.github.io/voicefixer.

研究动机与目标

  • 解决现有语音恢复模型仅针对单一类型失真(如去噪或去混响)进行孤立处理的局限性。
  • 开发一种统一框架,能够恢复由多种同时存在的失真(如噪声、混响、削波和低带宽)导致的语音信号。
  • 从严重退化的输入(如历史录音)中实现高保真(44.1 kHz)语音恢复,提升感知质量,超越低保真或单失真方法的性能。
  • 通过用端到端可训练的统一架构替代级联模型,降低计算成本并减少伪影累积。
  • 发布预训练模型与代码库,以加速多失真语音恢复领域的未来研究。

提出的方法

  • 该框架采用两阶段设计:第一阶段为分析阶段,使用基于 ResUNet 的网络从退化语音中估计梅尔频谱图;第二阶段为合成阶段,通过神经声码器(TFGAN)生成高保真波形。
  • 中间特征以低维梅尔频谱图表示,作为统一多种失真恢复的共享表征。
  • 失真被建模为一系列操作的复合函数:加性噪声、与房间脉冲响应卷积(混响),以及在固定范围内的振幅削波。
  • 分析模块训练目标为从退化输入中预测干净的梅尔频谱图;合成模块则在大规模语音数据集上预训练,以从梅尔特征生成高质量波形。
  • 整个系统采用两阶段训练方式:分析与合成阶段分别优化,利用预训练声码器先验知识以提升波形生成质量。
  • 该框架支持多失真恢复与语音超分辨率,可将低带宽语音(1–22.05 kHz)扩展至 44.1 kHz 全带宽。

实验结果

研究问题

  • RQ1统一的深度学习框架能否有效恢复由多种同时存在的失真(如噪声、混响、削波和低带宽)导致的语音?
  • RQ2与直接建模波形或频谱图相比,使用梅尔频谱图作为中间特征是否能提升多失真语音恢复的鲁棒性与性能?
  • RQ3统一框架能否在严重退化输入下实现高保真(44.1 kHz)语音恢复,并使感知质量接近干净语音水平?
  • RQ4在客观指标(PESQ、SSIM、LSD)与主观 MOS 方面,VoiceFixer 与级联模型或任务专用基线相比表现如何?
  • RQ5预训练的神经声码器在统一恢复流程中,能在多大程度上泛化至从估计的梅尔频谱图恢复高保真波形?

主要发现

  • VoiceFixer 在 HiFi-Res 测试集上取得 3.62 的平均意见得分(MOS),比基线 UNet 方法高出 0.256,仅比 Oracle-Mel 参考结果低 0.11。
  • 在 VD-Test 去噪基准测试中,VoiceFixer 的 PESQ-wb 得分为 2.43,优于 SEGAN、WaveUNet 和弱标签模型(WL-Model),并达到目标 MOS 3.69。
  • 在去削波任务中,VoiceFixer 在两种削波水平(0.25 和 0.1)下均取得 3.38 的 MOS,分别优于 SSPADE 0.04 和 1.25 分,表明其具有更优的主观感知质量。
  • 尽管在 PESQ-wb 和 SSIM 等客观指标上得分较低,VoiceFixer 在主观 MOS 上表现出最强提升,表明感知质量的改善未必能被标准客观度量完全捕捉。
  • 该框架成功将低带宽语音(1–22.05 kHz)恢复为 44.1 kHz 全带宽输出,生成的波形具有增强的高频能量,从而提升听觉感知质量。
  • 预训练模型与代码库的发布,为多失真语音恢复领域的未来研究提供了支持,并可扩展至更多类型的失真。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。