[论文解读] VToonify: Controllable High-Resolution Portrait Video Style Transfer
VToonify 提出了一种新颖的全卷积框架,用于可控的、高分辨率的人像视频风格迁移,克服了现有基于 StyleGAN 方法在固定尺寸和对齐人脸方面的要求限制。通过从预训练的 StyleGAN 模型中蒸馏数据与结构,并利用多尺度内容特征与人脸分割图,该方法实现了对未对齐、可变尺寸视频输入的高保真、时序一致的风格迁移,同时支持对风格强度、色彩和结构的灵活控制。
Generating high-quality artistic portrait videos is an important and desirable task in computer graphics and vision. Although a series of successful portrait image toonification models built upon the powerful StyleGAN have been proposed, these image-oriented methods have obvious limitations when applied to videos, such as the fixed frame size, the requirement of face alignment, missing non-facial details and temporal inconsistency. In this work, we investigate the challenging controllable high-resolution portrait video style transfer by introducing a novel VToonify framework. Specifically, VToonify leverages the mid- and high-resolution layers of StyleGAN to render high-quality artistic portraits based on the multi-scale content features extracted by an encoder to better preserve the frame details. The resulting fully convolutional architecture accepts non-aligned faces in videos of variable size as input, contributing to complete face regions with natural motions in the output. Our framework is compatible with existing StyleGAN-based image toonification models to extend them to video toonification, and inherits appealing features of these models for flexible style control on color and intensity. This work presents two instantiations of VToonify built upon Toonify and DualStyleGAN for collection-based and exemplar-based portrait video style transfer, respectively. Extensive experimental results demonstrate the effectiveness of our proposed VToonify framework over existing methods in generating high-quality and temporally-coherent artistic portrait videos with flexible style controls.
研究动机与目标
- 解决现有图像卡通化模型在应用于视频时的局限性,如固定分辨率、人脸对齐要求以及时序不一致性。
- 实现在未对齐、可变尺寸的人像视频上,高达 1024×1024 分辨率的时序一致风格迁移。
- 通过允许用户调整风格强度并从集合中选择参考风格,支持灵活、可控的风格迁移。
- 在结构和色彩风格变化的情况下,保持非面部细节并维持输出的身份一致性。
- 将现有的基于 StyleGAN 的图像卡通化模型扩展至视频领域,同时继承其可控性与高质量生成能力。
提出的方法
- 该框架采用混合设计,结合全卷积网络以支持可变输入尺寸,以及蒸馏后的基于 StyleGAN 的模型以实现高分辨率和可控的风格生成。
- 通过编码器提取多尺度内容特征,并与来自预训练 StyleGAN 主干网络的风格码融合,以重建细节丰富的图像。
- 使用人脸分割图作为辅助监督,以提升风格化人脸中结构保真度,尤其在眼睛和鼻子等精细细节方面。
- 通过适配风格码注入机制,该方法同时支持基于集合的(Toonify)和基于样本的(DualStyleGAN)风格迁移。
- 应用基于均匀光流的闪烁抑制损失,以减少视频序列中的时序伪影。
- 通过蒸馏训练:使用来自 StyleGAN 的合成配对数据来监督一个轻量级、具备视频处理能力的网络。
实验结果
研究问题
- RQ1视频风格迁移框架是否能在无需人脸对齐或固定输入尺寸的情况下,实现高达 1024×1024 分辨率的时序一致风格迁移?
- RQ2多尺度内容特征与人脸分割图在提升视频中风格化人脸结构和非面部细节保真度方面有何作用?
- RQ3该框架在视频设置下,对灵活风格控制(包括风格强度和基于参考的风格迁移)的支持程度如何?
- RQ4从预训练的 StyleGAN 模型中同时蒸馏数据与模型架构,对视频风格迁移中的性能与泛化能力有何影响?
- RQ5该框架的关键失败模式是什么?它们与底层 StyleGAN 主干网络中的偏差有何关联?
主要发现
- VToonify 在高分辨率人像视频风格迁移任务中达到最先进性能,即使在未对齐人脸和可变输入尺寸下,也能生成时序一致的结果。
- 引入人脸分割图显著提升了风格化人脸的结构准确性,尤其在眼睛和面部轮廓等精细细节方面。
- 该框架支持灵活的风格控制,包括可调节的风格强度和基于样本的风格迁移,生成结果与参考风格图像高度一致。
- 通过从预训练的 StyleGAN 模型中同时蒸馏数据与模型架构,VToonify 继承了高质量生成能力,同时克服了原始模型在固定分辨率和对齐方面的要求限制。
- 尽管具备诸多优势,该方法仍继承了 StyleGAN 主干网络的局限性,包括对极端面部角度、视线方向以及特定风格下模糊背景的处理能力较差。
- 通过基于均匀光流的损失,框架有效减少了闪烁现象,但在饱和区域或复杂运动区域仍存在部分闪烁残留。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。