Skip to main content
QUICK REVIEW

[论文解读] Learning Individual Speaking Styles for Accurate Lip to Speech Synthesis

K R Prajwal, Rudrabha Mukhopadhyay|arXiv (Cornell University)|May 17, 2020
Speech and Audio Processing参考文献 41被引用 10
一句话总结

该论文提出Lip2Wav,一种序列到序列模型,能够从非受限、大规模词汇量的唇部视频中学习个体说话风格,从而合成准确、自然的语音。通过利用一种新型的120小时、特定说话人的数据集(相比之前的工作,数据量多80倍,每位说话人词汇量大100倍),该方法在非受限设置下实现了比以往方法高四倍的语音可懂度。

ABSTRACT

Humans involuntarily tend to infer parts of the conversation from lip movements when the speech is absent or corrupted by external noise. In this work, we explore the task of lip to speech synthesis, i.e., learning to generate natural speech given only the lip movements of a speaker. Acknowledging the importance of contextual and speaker-specific cues for accurate lip-reading, we take a different path from existing works. We focus on learning accurate lip sequences to speech mappings for individual speakers in unconstrained, large vocabulary settings. To this end, we collect and release a large-scale benchmark dataset, the first of its kind, specifically to train and evaluate the single-speaker lip to speech task in natural settings. We propose a novel approach with key design choices to achieve accurate, natural lip to speech synthesis in such unconstrained scenarios for the first time. Extensive evaluation using quantitative, qualitative metrics and human evaluation shows that our method is four times more intelligible than previous works in this space. Please check out our demo video for a quick overview of the paper, method, and qualitative results. https://www.youtube.com/watch?v=HziA-jmlk_4&feature=youtu.be

研究动机与目标

  • 为解决在非受限、大规模词汇量设置下准确的唇语到语音合成挑战,聚焦于个体说话人而非多说话人或受限设置。
  • 通过建模说话人特定和上下文相关的音视频线索,克服同音异义音素(听觉上不同但唇形相似)的歧义性。
  • 收集并发布一个大规模、公开可用的基准数据集(Lip2Wav),包含每位说话人120小时自然、非受限的语音,以支持稳健的单说话人唇语到语音建模。
  • 开发一种序列到序列模型,通过长期观察单个说话人的唇部视频,生成具有语调、可懂的语音。
  • 证明通过长程视觉建模捕捉说话人特定动态,可显著提升语音合成的质量和可懂度。

提出的方法

  • 该方法采用序列到序列架构,其中基于3D-CNN的视觉编码器处理来自视频帧的时空唇部运动,捕捉空间和时间特征。
  • 模型使用3秒的上下文窗口(比之前工作长约6倍),通过上下文共现模式改善同音异义音素的歧义消除。
  • 基于Transformer的解码器自回归地生成语音,条件于视觉特征,并通过自注意力机制关注相关唇部帧。
  • 在训练过程中逐渐衰减教师强制(从约30K次迭代开始),以提升泛化能力并减少对训练词汇表的过拟合。
  • 视觉编码器被设计为对口部区域高度关注,激活图和注意力对齐曲线证实其对唇部运动有强烈聚焦。
  • 评估了不同视觉编码器架构(2D-CNN、2D+1D-CNN、3D-CNN),其中3D-CNN在捕捉时空动态方面表现最优。

实验结果

研究问题

  • RQ1仅通过长期观察唇部动作,无需人工标注,数据驱动模型能否学习到准确的、说话人特定的语音模式?
  • RQ2增加唇部动作的上下文窗口,对唇语到语音合成中同音异义音素的歧义消除有何影响?
  • RQ3渐进式教师强制衰减在多大程度上能提升模型在未见词汇上的泛化能力和性能?
  • RQ4不同视觉编码器架构在捕捉唇部视频用于准确语音合成的时空特征方面表现如何?
  • RQ5在大规模、非受限、单说话人数据集上训练的序列到序列模型,能否显著优于以往的多说话人或小词汇量方法,在可懂度和自然度方面?

主要发现

  • 所提出的Lip2Wav模型在未见测试集上的语音可懂度比以往方法高出四倍,STOI(0.446)、ESTOI(0.311)和PESQ(1.290)指标均得到验证。
  • 使用3秒上下文窗口显著优于更短窗口(0.5秒和1.5秒),STOI从0.264提升至0.446,证明长程上下文具有显著优势。
  • 渐进式教师强制衰减提升了模型泛化能力,STOI从恒定强制的0.221提升至0.446,表明对训练词汇表的过拟合减少。
  • 3D-CNN视觉编码器优于2D-CNN和2D+1D-CNN变体,取得最高的STOI(0.446)、ESTOI(0.311)和PESQ(1.290)得分。
  • 人工评估确认,生成的语音比以往工作更自然、更具语调感,在非受限环境中可懂度更高。
  • 注意力可视化证实,模型强烈依赖口部区域,并将解码器输出与对应唇部帧对齐,验证了其对相关视觉线索的关注。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。