Skip to main content
QUICK REVIEW

[论文解读] TalkCLIP: Talking Head Generation with Text-Guided Expressive Speaking Styles

Yifeng Ma, Suzhen Wang|arXiv (Cornell University)|Apr 1, 2023
Face recognition and analysis被引用 6
一句话总结

TalkCLIP 提出了一种基于文本引导的一次性说话头生成方法,通过自然语言描述而非参考视频来控制富有表现力的面部动画。通过利用基于 CLIP 的风格编码器将文本映射到说话风格嵌入,该方法实现了逼真的、富有表现力的说话头,并在未见文本描述上表现出强大的泛化能力,在与文本和音频的一致性方面优于现有方法。

ABSTRACT

Audio-driven talking head generation has drawn growing attention. To produce talking head videos with desired facial expressions, previous methods rely on extra reference videos to provide expression information, which may be difficult to find and hence limits their usage. In this work, we propose TalkCLIP, a framework that can generate talking heads where the expressions are specified by natural language, hence allowing for specifying expressions more conveniently. To model the mapping from text to expressions, we first construct a text-video paired talking head dataset where each video has diverse text descriptions that depict both coarse-grained emotions and fine-grained facial movements. Leveraging the proposed dataset, we introduce a CLIP-based style encoder that projects natural language-based descriptions to the representations of expressions. TalkCLIP can even infer expressions for descriptions unseen during training. TalkCLIP can also use text to modulate expression intensity and edit expressions. Extensive experiments demonstrate that TalkCLIP achieves the advanced capability of generating photo-realistic talking heads with vivid facial expressions guided by text descriptions.

研究动机与目标

  • 解决音频驱动说话头生成中难以找到具有所需说话风格的参考视频的问题。
  • 实现通过自然语言描述而非参考视频控制富有表现力的说话头生成。
  • 构建一个文本-视频配对数据集,包含粗粒度情绪标签和细粒度面部动作单元(AU)注释,用于训练。
  • 开发一种基于 CLIP 的文本到说话风格编码器,使其能泛化到域外(OOD)的文本描述。
  • 实现高保真、逼真的说话头视频,其面部表情由文本引导保持一致。

提出的方法

  • 在 MEAD 数据集上以提示为基础添加两层文本描述:粗粒度情绪标签和基于 AU 的细粒度面部动作描述。
  • 设计一种基于 CLIP 的文本到说话风格(T2SS)编码器,将自然语言描述映射到潜在说话风格代码。
  • 引入一个轻量级适配器网络,将 CLIP 文本嵌入映射到说话风格空间,弥合静态文本嵌入与动态面部运动之间的差距。
  • 使用视频到说话风格(V2SS)编码器从参考视频中提取风格表征,实现 T2SS 与 V2SS 输出之间的对比学习。
  • 通过最小化同一视频在 T2SS 编码器生成的潜在风格代码与 V2SS 编码器输出之间的距离,训练 T2SS 编码器。
  • 将学习到的风格代码与音频驱动的面部动画解码器及图像渲染器集成,生成逼真的说话头视频。

实验结果

研究问题

  • RQ1在无需匹配参考视频的情况下,自然语言描述能否有效控制一次性说话头生成中的富有表现力的说话风格?
  • RQ2基于 CLIP 的文本编码器在推理域外(OOD)文本描述(训练中未见)时,其泛化能力如何?
  • RQ3基于文本的风格控制在唇部同步和面部表情一致性方面,与基于视频的参考风格控制相比,性能匹配或超越的程度如何?
  • RQ4基于提示的文本注释(情绪 + AU)在捕捉与面部运动模式的语义对应关系方面有多有效?
  • RQ5在处理抽象语言、习语或音频-情绪不一致时,基于文本的风格控制存在哪些局限性?

主要发现

  • TalkCLIP 在所有对比方法中取得了最高的唇部同步得分,表明其具有出色的音视频对齐能力。
  • 该方法在视频逼真度得分上表现具有竞争力,与使用相同图像渲染器的最先进方法相当。
  • TalkCLIP 在风格一致性方面优于基于视频的基线方法(EAMM、GC-AVT),并达到最佳性能方法(StyleTalk)的水平。
  • 在与文本描述的风格一致性方面,显著优于所有基线方法,证明了文本到风格对齐的有效性。
  • 用户研究表明,77% 的文本描述被评价为准确描述了情绪,73% 被评价为准确描述了面部动作,验证了 TA-MEAD 数据集的质量。
  • 该方法能泛化到域外文本描述,包括抽象表达和习语,但对高度习语化或隐喻性语言的性能有所下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。