Skip to main content
QUICK REVIEW

[论文解读] Free-form Video Inpainting with 3D Gated Convolution and Temporal PatchGAN

Ya-Liang Chang, Zhe Yu Liu|arXiv (Cornell University)|Apr 23, 2019
Generative Adversarial Networks and Image Synthesis参考文献 34被引用 10
一句话总结

本文提出了一种基于学习的首次用于自由形状视频修复的方法,采用3D门控卷积处理任意形状的掩码,并引入一种新颖的时序PatchGAN损失以确保时序一致性。该方法在FaceForensics和新收集的FVI数据集上均取得了最先进性能,在视频质量和连贯性方面优于先前方法。

ABSTRACT

Free-form video inpainting is a very challenging task that could be widely used for video editing such as text removal. Existing patch-based methods could not handle non-repetitive structures such as faces, while directly applying image-based inpainting models to videos will result in temporal inconsistency (see http://bit.ly/2Fu1n6b ). In this paper, we introduce a deep learn-ing based free-form video inpainting model, with proposed 3D gated convolutions to tackle the uncertainty of free-form masks and a novel Temporal PatchGAN loss to enhance temporal consistency. In addition, we collect videos and design a free-form mask generation algorithm to build the free-form video inpainting (FVI) dataset for training and evaluation of video inpainting models. We demonstrate the benefits of these components and experiments on both the FaceForensics and our FVI dataset suggest that our method is superior to existing ones. Related source code, full-resolution result videos and the FVI dataset could be found on Github https://github.com/amjltc295/Free-Form-Video-Inpainting .

研究动机与目标

  • 为解决自由形状视频修复的挑战,即缺失区域具有任意形状,且现有方法难以保持时序一致性。
  • 克服基于块的方法在处理人脸等非重复结构时的局限性。
  • 将基于图像的修复模型扩展至视频任务,同时避免引入闪烁或时序不一致现象。
  • 构建一个新的数据集及掩码生成算法,用于自由形状视频修复模型的训练与评估。
  • 证明3D门控卷积与时序PatchGAN可显著提升视频质量和时序连贯性。

提出的方法

  • 提出3D门控卷积层,能够学习区分视频体素中的掩码区域、未掩码区域和填充区域,从而在自由形状掩码不确定性下实现更优的特征关注。
  • 引入时序PatchGAN判别器,通过惩罚高频时空特征来增强生成视频的时序一致性。
  • 设计一种自由形状掩码生成算法,生成多样且逼真的掩码,掩码与帧面比例各异,用于数据增强。
  • 构建FVI数据集,包含来自YouTube-VOS的1940个视频和来自YouTube-BoundingBoxes的12,600个视频,用于训练与评估。
  • 结合对抗性损失、感知损失和L1损失,优化生成器以实现逼真且连贯的视频补全。
  • 采用单阶段、前馈式架构,无需光流,支持快速推理与端到端训练。

实验结果

研究问题

  • RQ13D门控卷积能否有效应对自由形状掩码在视频修复中引入的不确定性?
  • RQ2与标准GAN相比,时序PatchGAN判别器是否能显著提升视频生成的时序一致性?
  • RQ3所提方法在处理人脸等复杂非重复结构方面,相较于基于块和基于图像的修复模型表现如何?
  • RQ4新FVI数据集在多大程度上提升了自由形状视频修复模型的训练与评估效果?
  • RQ5所提架构能否扩展至其他视频生成任务,如超分辨率或物体移除?

主要发现

  • 所提模型在FaceForensics数据集上达到最先进性能,Fréchet视频距离(FVD)为1.034,FID为1.096,优于先前方法。
  • 在新引入的FVI数据集(含类物体掩码)上,模型FVD为0.1209,FID为1.034,展现出强大的泛化能力与质量表现。
  • 消融实验表明,3D门控卷积与时序PatchGAN损失均至关重要,任一移除均导致性能显著下降。
  • 模型成功推广至视频超分辨率任务,在4倍上采样下实现感知距离(LPIPS)0.1631,FID 1.096,优于SRResNet与SRGAN。
  • 模型可扩展至视频物体移除与插值任务,展现出在多种视频生成任务中的鲁棒性与通用性。
  • 尽管在处理极不相同测试数据或极厚掩码时存在局限,但与基线方法相比,模型在视觉连贯性与时序稳定性方面仍保持显著优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。