Skip to main content
QUICK REVIEW

[论文解读] Real-Time Lip Sync for Live 2D Animation

Deepali Aneja, Wilmot Li|arXiv (Cornell University)|Oct 19, 2019
Speech and Audio Processing参考文献 29被引用 9
一句话总结

本文提出了一种基于深度学习的实时唇形同步系统,用于实时2D动画,采用LSTM模型处理流式音频,延迟低于200ms,生成准确的音素序列。通过有针对性的特征工程和数据增强,该方法仅需极少的手动动画训练数据(13–20分钟),即可实现高质量结果,在人类评估中优于实时与离线方法。

ABSTRACT

The emergence of commercial tools for real-time performance-based 2D animation has enabled 2D characters to appear on live broadcasts and streaming platforms. A key requirement for live animation is fast and accurate lip sync that allows characters to respond naturally to other actors or the audience through the voice of a human performer. In this work, we present a deep learning based interactive system that automatically generates live lip sync for layered 2D characters using a Long Short Term Memory (LSTM) model. Our system takes streaming audio as input and produces viseme sequences with less than 200ms of latency (including processing time). Our contributions include specific design decisions for our feature definition and LSTM configuration that provide a small but useful amount of lookahead to produce accurate lip sync. We also describe a data augmentation procedure that allows us to achieve good results with a very small amount of hand-animated training data (13-20 minutes). Extensive human judgement experiments show that our results are preferred over several competing methods, including those that only support offline (non-live) processing. Video summary and supplementary results at GitHub link: https://github.com/deepalianeja/CharacterLipSync2D

研究动机与目标

  • 实现实时、高质量的2D动画唇形同步,使角色能够以低延迟自然响应现场语音。
  • 解决在无字幕信息且无显著前瞻时间的情况下,因实时处理限制而难以生成准确音素序列的挑战。
  • 通过开发有效的数据增强策略,减少对大量手工标注训练数据的依赖。
  • 通过在LSTM架构中引入少量前瞻时间,提升音素过渡的时机准确性,从而改善唇形同步的感知质量。
  • 构建一个足够稳健的系统,适用于现场表演场景,无法进行后期处理优化。

提出的方法

  • 系统使用长短期记忆(LSTM)循环神经网络,将实时流式音频输入映射为离散音素序列。
  • 音频特征经过精心设计,以捕捉与音素过渡相关的语音内容,包括频谱和时间特性。
  • 在LSTM架构中引入少量前瞻(几帧),以提升音素过渡的时机准确性。
  • 应用数据增强流程,对源自现有手工动画序列的合成数据进行处理,提升有效训练数据规模,同时保持风格一致性。
  • 使用交叉熵损失函数进行模型训练,基于音频输入在每个时间步预测正确的音素。
  • 系统针对低延迟推理进行优化,实现低于200ms的处理延迟,适用于现场表演。

实验结果

研究问题

  • RQ1深度学习模型能否从流式音频中生成准确、低延迟的实时音素序列,用于2D角色?
  • RQ2如何有效利用少量手工动画训练数据,训练出鲁棒的唇形同步模型?
  • RQ3少量前瞻在改善音素过渡感知质量方面起到什么作用?
  • RQ4数据增强技术能否在训练数据有限的情况下显著提升模型泛化能力?
  • RQ5生成的唇形同步在感知质量上与现有离线和实时方法相比如何?

主要发现

  • 所提出的系统实现端到端延迟低于200ms,支持实时响应,具备良好的互动性。
  • 人类评估显示,该系统的结果优于多种竞争方法,包括需要离线处理的方法。
  • 仅使用13–20分钟的手动动画训练数据,模型即可实现高质量结果,得益于有效的数据增强与特征工程。
  • 在LSTM架构中引入少量前瞻,显著提升了音素过渡的准确性,减少了感知上令人反感的错误。
  • 模型能良好泛化至不同2D动画风格,并可应用于具有离散音素的风格化3D动画,包括定格动画和渲染3D动画。
  • 通过广泛的主观判断实验验证,该系统在感知质量上优于现有商业工具。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。