[论文解读] An Internal Learning Approach to Video Inpainting
本文提出了一种新颖的视频修复方法,通过在单个视频内部进行内部学习,联合生成缺失的外观和光流,而无需依赖外部训练数据。通过将深度图像先验(DIP)框架扩展至视频领域,采用外观与光流的联合优化,该方法在保持强时间一致性的同时显著减少了失真,即使在长时序范围的孔洞修复中也取得了最先进性能。
We propose a novel video inpainting algorithm that simultaneously hallucinates missing appearance and motion (optical flow) information, building upon the recent 'Deep Image Prior' (DIP) that exploits convolutional network architectures to enforce plausible texture in static images. In extending DIP to video we make two important contributions. First, we show that coherent video inpainting is possible without a priori training. We take a generative approach to inpainting based on internal (within-video) learning without reliance upon an external corpus of visual data to train a one-size-fits-all model for the large space of general videos. Second, we show that such a framework can jointly generate both appearance and flow, whilst exploiting these complementary modalities to ensure mutual consistency. We show that leveraging appearance statistics specific to each video achieves visually plausible results whilst handling the challenging problem of long-term consistency.
研究动机与目标
- 解决在不依赖大规模外部数据集或预训练模型的情况下进行视频修复的挑战。
- 确保修复后的视频序列具有高度的时间一致性,尤其是在长距离帧之间。
- 探索仅利用输入视频自身结构的内部学习是否可作为视频生成的有效归纳偏置。
- 通过联合优化外观与运动(光流)来提升相互一致性与视觉合理性。
- 证明标准2D CNN架构可通过在单个视频上进行内部训练,隐式学习时间先验。
提出的方法
- 该方法采用受深度图像先验(DIP)启发的2D编码器-解码器CNN架构,在输入视频上直接进行训练,无需外部预训练。
- 通过一次前向传播联合预测修复后的外观与光流场,实现端到端优化。
- 采用一致性感知的训练策略,通过外观与运动预测之间的相互依赖关系,强制实现时间一致性。
- 框架使用k个连续帧的窗口化输入,网络在视频的掩码版本上进行训练,以重建缺失区域。
- 通过反向传播进行优化,损失函数结合了外观与光流的L1损失,以及用于结构保真度的感知损失。
- 该方法利用帧间视觉模式的内部重复性,实现在无显式时间建模的情况下,长期序列中结构信息的有效传播。
实验结果
研究问题
- RQ1在视频修复中,单个视频内的内部学习是否可以替代大规模外部数据集的需求?
- RQ2如何联合优化外观与运动(光流)以提升视频修复的时间一致性?
- RQ3标准2D CNN架构在无显式循环或3D卷积的情况下,能在多大程度上隐式学习时间依赖关系?
- RQ4与逐帧或仅外观的方法相比,外观与光流的联合优化是否能带来更好的视觉合理性与更低的失真?
- RQ5输入帧的窗口长度在多大程度上影响修复结果的泛化能力与重建质量?
主要发现
- 该方法在无需任何外部训练数据的情况下实现了最先进水平的视频修复性能,在时间一致性和视觉质量方面优于逐帧DIP和基于图像块的基线方法。
- 外观与光流的联合预测显著提升了时间一致性,减少了视觉伪影与运动不一致现象。
- 随着输入窗口长度的增加,孔洞区域的修复质量得到提升,表明具备有效的长时序泛化能力。
- 由于过拟合,非孔洞区域的重建质量随窗口长度增加而下降,证实了孔洞填充与重建保真度之间的权衡。
- 所学习的特征在实例级别上表现出优越的帧间对应关系,能够长期识别同一对象,而VGG-pool5特征仅能捕捉一般相似性。
- 该方法通过利用深度网络先验,成功避免了基于图像块方法常见的形状失真,尤其在复杂运动场景中表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。