Skip to main content
QUICK REVIEW

[论文解读] Blind Video Temporal Consistency via Deep Video Prior

Chenyang Lei, Yazhou Xing|arXiv (Cornell University)|Oct 22, 2020
Image Enhancement Techniques参考文献 42被引用 14
一句话总结

本文提出了一种新颖的、通用的盲视频时序一致性方法,通过利用深度视频先验:从零开始在单个视频上训练一个卷积神经网络,以实现时序一致性,而无需依赖光流或手工设计的正则化方法。该方法在七个视频任务中实现了最先进性能,时序一致性与感知质量更优,并采用迭代加权训练策略解决多模态不一致问题。

ABSTRACT

Applying image processing algorithms independently to each video frame often leads to temporal inconsistency in the resulting video. To address this issue, we present a novel and general approach for blind video temporal consistency. Our method is only trained on a pair of original and processed videos directly instead of a large dataset. Unlike most previous methods that enforce temporal consistency with optical flow, we show that temporal consistency can be achieved by training a convolutional network on a video with the Deep Video Prior. Moreover, a carefully designed iteratively reweighted training strategy is proposed to address the challenging multimodal inconsistency problem. We demonstrate the effectiveness of our approach on 7 computer vision tasks on videos. Extensive quantitative and perceptual experiments show that our approach obtains superior performance than state-of-the-art methods on blind video temporal consistency. Our source codes are publicly available at github.com/ChenyangLEI/deep-video-prior.

研究动机与目标

  • 解决由独立帧处理图像算法导致的视频时序不一致问题,此类问题常引发闪烁和视觉伪影。
  • 开发一种通用框架,可应用于任意图像处理算法,而无需针对特定任务重新训练。
  • 消除对光流或显式时序正则化的依赖,转而通过卷积神经网络训练隐式学习视频先验。
  • 有效解决多模态不一致问题,即相似帧在多个合理模式下产生不同输出的情况。
  • 在与最先进方法相比性能损失最小的前提下,实现高时序一致性。

提出的方法

  • 该方法仅使用原始视频和处理后视频作为输入,在单个测试视频上从零开始训练卷积神经网络,无需任何外部数据集。
  • 通过训练网络在视频帧间对应空间块上产生一致输出,利用网络架构的归纳偏差来强制实现时序一致性。
  • 其核心思想受深度图像先验(DIP)启发,即网络结构本身可作为先验,在过拟合到闪烁伪影之前重建自然视频内容。
  • 引入一种迭代加权训练(IRT)策略,通过在帧间选择单一主导模式来解决多模态不一致问题。
  • 训练过程在数据保真度与时序一致性之间取得平衡,基于小部分帧的验证结果进行早停。
  • 该框架与网络架构无关,可与多种CNN(如U-Net、FCN、ResUnet)结合使用,50帧视频的每帧推理时间约为2秒。

实验结果

研究问题

  • RQ1仅在单个视频上进行训练的卷积神经网络,能否在不显式使用光流或变形约束的情况下隐式学习时序一致性?
  • RQ2卷积神经网络架构的归纳偏差——特别是其在过拟合到闪烁伪影前重建自然内容的能力——能否被用作时序一致性的深度视频先验?
  • RQ3在盲视频处理设置下,如何有效解决相似帧产生不同输出的多模态不一致问题?
  • RQ4该方法在无需任务特定适配的情况下,能在多大程度上泛化到多样化的视频处理任务?
  • RQ5数据保真度与时序一致性之间的权衡如何?在训练过程中如何有效管理这一权衡?

主要发现

  • 所提方法在包括视频着色、去噪和超分辨率在内的七个多样化计算机视觉任务中,均实现了优于最先进方法的时序一致性。
  • 迭代加权训练(IRT)策略成功解决了多模态不一致问题,确保帧间选择单一感知一致的模式。
  • 时序一致性在训练25至50个周期后趋于稳定,且在不同长度和运动水平的视频上表现良好。
  • 该方法无需大规模预训练或外部数据集,仅依赖测试视频进行训练。
  • 该方法展现出强大的泛化能力,可有效适配多种CNN架构,包括U-Net、FCN和ResUnet。
  • 尽管推理时间较长(例如,50帧视频每帧约2秒),但其感知质量和一致性优于基于光流的基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。