Skip to main content
QUICK REVIEW

[论文解读] Deep Flow-Guided Video Inpainting

Rui Xu, Xiaoxiao Li|arXiv (Cornell University)|May 8, 2019
Generative Adversarial Networks and Image Synthesis参考文献 26被引用 4
一句话总结

本文提出了一种基于深度流引导的视频修复方法,将视频修复问题视为由已完成的光流场引导的像素传播问题。通过使用一种新颖的端到端粗到细深度流完成网络(含困难样本挖掘),该方法在DAVIS和YouTube-VOS基准上实现了最先进的修复质量与速度,显著优于基于优化的方法和直接的深度学习方法。

ABSTRACT

Video inpainting, which aims at filling in missing regions of a video, remains challenging due to the difficulty of preserving the precise spatial and temporal coherence of video contents. In this work we propose a novel flow-guided video inpainting approach. Rather than filling in the RGB pixels of each frame directly, we consider video inpainting as a pixel propagation problem. We first synthesize a spatially and temporally coherent optical flow field across video frames using a newly designed Deep Flow Completion network. Then the synthesized flow field is used to guide the propagation of pixels to fill up the missing regions in the video. Specifically, the Deep Flow Completion network follows a coarse-to-fine refinement to complete the flow fields, while their quality is further improved by hard flow example mining. Following the guide of the completed flow, the missing video regions can be filled up precisely. Our method is evaluated on DAVIS and YouTube-VOS datasets qualitatively and quantitatively, achieving the state-of-the-art performance in terms of inpainting quality and speed.

研究动机与目标

  • 为解决在复杂运动和任意缺失区域下保持空间与时间一致性的视频修复挑战。
  • 克服基于块的优化方法在复杂运动下表现不佳且计算成本高的局限性。
  • 通过从直接像素修复转向流引导的像素传播,减轻计算负担并减少时间伪影。
  • 通过粗到细的优化与困难样本挖掘,提升缺失区域中的流完成质量。
  • 在不假设运动或缺失区域形状的前提下,实现近实时性能。

提出的方法

  • 设计了一种具有粗到细堆叠结构的深度流完成网络(DFC-Net),以逐帧逐步优化光流场。
  • 通过处理连续帧的批量输入,利用相邻帧之间的时序连续性,增强时间一致性。
  • 在每个阶段采用多尺度输入处理,以稳定训练并提升复杂区域的流精度。
  • 应用困难流样本挖掘,聚焦于运动边界和动态区域等挑战性区域,提升完成质量。
  • 流完成之后,利用估计的光流双向执行像素传播,以填充缺失区域,随后对残差区域应用图像修复。
  • 该方法将问题解耦:首先优先完成流,然后进行流引导的像素传播,最后通过图像修复进行最终优化。

实验结果

研究问题

  • RQ1能否将光流完成用作比直接基于像素的视频修复更高效、更准确的替代方案?
  • RQ2如何设计深度网络,以在任意形状的缺失区域中完成光流,同时保持时间一致性?
  • RQ3哪些架构组件(如粗到细、多尺度、困难样本挖掘)最有效地提升流完成质量?
  • RQ4流引导的像素传播在多大程度上减轻了残差修复负担并提升了视觉质量?
  • RQ5在真实世界视频数据集上,该方法与基于优化和端到端深度学习的方法相比,在速度和性能上表现如何?

主要发现

  • 在DAVIS数据集上,该方法实现了28.26的PSNR和0.48的SSIM,优于先前方法(如Huang等人,PSNR 27.73,SSIM 0.45,使用FlowNet2)。
  • 消融实验表明,流引导的像素传播将PSNR从19.43提升至27.50,SSIM从0.24提升至0.41,证明其在性能中的关键作用。
  • 堆叠的DFC-Net结合多尺度输入实现了0.93的端点误差(EPE),优于单阶段DFC-Single(EPE 0.97)和非多尺度变体(EPE 0.95)。
  • 困难样本挖掘显著提升了动态区域和边界区域的流质量,从而改善了整体修复结果。
  • 该方法显著快于基于优化的方法,可在几分钟内完成90帧视频的处理,而非数小时。
  • 失败案例主要源于物体边缘处光流估计不准确,表明未来工作需提升流估计的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。