Skip to main content
QUICK REVIEW

[论文解读] ReVISE: Self-Supervised Speech Resynthesis with Visual Input for Universal and Generalized Speech Enhancement

Wei-Ning Hsu, Tal Remez|arXiv (Cornell University)|Dec 21, 2022
Speech and Audio Processing被引用 4
一句话总结

ReVISE 提出了一种通用的、自监督的音视频语音增强框架,通过利用视觉输入和自监督语音模型的离散单元,统一了多种退化类型(如噪声、混响、分离、补全以及视频到语音合成)的语音增强任务。该方法在合成数据集(LRS3)和真实世界数据集(EasyCom)上均取得了最先进性能,显著提升了语音可懂度和质量,且无需文本监督。

ABSTRACT

Prior works on improving speech quality with visual input typically study each type of auditory distortion separately (e.g., separation, inpainting, video-to-speech) and present tailored algorithms. This paper proposes to unify these subjects and study Generalized Speech Enhancement, where the goal is not to reconstruct the exact reference clean signal, but to focus on improving certain aspects of speech. In particular, this paper concerns intelligibility, quality, and video synchronization. We cast the problem as audio-visual speech resynthesis, which is composed of two steps: pseudo audio-visual speech recognition (P-AVSR) and pseudo text-to-speech synthesis (P-TTS). P-AVSR and P-TTS are connected by discrete units derived from a self-supervised speech model. Moreover, we utilize self-supervised audio-visual speech model to initialize P-AVSR. The proposed model is coined ReVISE. ReVISE is the first high-quality model for in-the-wild video-to-speech synthesis and achieves superior performance on all LRS3 audio-visual enhancement tasks with a single model. To demonstrates its applicability in the real world, ReVISE is also evaluated on EasyCom, an audio-visual benchmark collected under challenging acoustic conditions with only 1.6 hours of training data. Similarly, ReVISE greatly suppresses noise and improves quality. Project page: https://wnhsu.github.io/ReVISE.

研究动机与目标

  • 将多种语音增强任务——去噪、去混响、分离、补全以及视频到语音合成——统一到一个通用框架中。
  • 通过提出一种可泛化于多种音频退化类型的通用增强方法,克服现有方法对特定退化类型依赖的局限性。
  • 在无需精确重建干净参考信号的情况下,提升语音可懂度、质量与同步性。
  • 实现高质量的真实场景视频到语音合成,这是以往模型未能达成的任务。
  • 在低资源、真实世界的音视频数据集(如 EasyCom)上展示数据效率与鲁棒性。

提出的方法

  • ReVISE 将语音增强建模为音视频语音重建任务,包含两个阶段:伪音视频语音识别(P-AVSR)与伪文本到语音合成(P-TTS)。
  • P-AVSR 从视觉输入和含噪音频中预测离散语音单元,使用自监督音视频模型(AV-HuBERT)进行初始化。
  • P-TTS 从预测的离散单元生成高保真音频,通过使用自监督语音单元作为中间表征,绕过文本监督。
  • 系统通过自监督语音模型(如 HuBERT)生成的离散单元连接 P-AVSR 与 P-TTS,实现在无转录文本情况下的端到端学习。
  • 模型在多种退化数据类型上进行端到端训练,包括合成退化(LRS3)和真实世界数据(EasyCom),无需任务特定微调。
  • 消融研究证实视觉输入、预训练以及自监督单元选择的重要性,更大模型和更优 SSL 单元可带来性能提升。

实验结果

研究问题

  • RQ1一个单一模型能否在包括去噪、分离、补全和视频到语音合成在内的多种语音退化类型上实现泛化?
  • RQ2在低资源或真实世界场景中,使用自监督语音单元而非文本是否能提升泛化能力与性能?
  • RQ3当音频严重退化或存在帧缺失时,视觉输入在提升语音可懂度与质量方面的有效性如何?
  • RQ4在一种退化类型(如去噪)上训练的模型能否零样本泛化到未见过的退化类型(如视频到语音合成)?
  • RQ5在自监督音视频表征上进行预训练,对下游增强任务性能的提升程度如何?

主要发现

  • ReVISE 使用单一统一模型在 LRS3 的全部四项增强任务(去噪、分离、补全与视频到语音)中均达到最先进性能。
  • 在仅含 1.6 小时训练数据的挑战性 EasyCom 基准上,ReVISE 相比强基线(基于掩码的方法)将词错误率(WER)降低最高达 37.5 个百分点,且平均意见得分(MOS)提升最高达 1.09。
  • 与之前模型相比,ReVISE 生成的音频质量更高:MOS 分数分别达到 4.19(通道 2)和 4.11(波束成形),显著优于原始远场录音(2.95 和 2.67)。
  • 模型在未针对该任务进行训练的情况下,实现了视频到语音合成的零样本泛化,展现出强大的鲁棒性与通用性。
  • 消融研究显示,使用 AV-HuBERT 预训练 P-AVSR 可实现 WER 降低 38.9%(基础模型)和 43.1%(大模型);视觉输入在所有任务中均提升性能,尤其在分离与补全任务中效果显著。
  • 使用在 Librispeech(LS960)上预训练的 HuBERT 单元可将 V2S WER 降低至 35.2,而使用在 LRS3+VoxCeleb2 上预训练的 AV-HuBERT 单元则为 41.2,表明预训练数据分布对性能有显著影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。