[论文解读] Blind Video Temporal Consistency via Deep Video Prior
本文提出了一种新颖的、通用的盲视频时序一致性方法,通过利用深度视频先验:从零开始在单个视频上训练一个卷积神经网络,以实现时序一致性,而无需依赖光流或手工设计的正则化方法。该方法在七个视频任务中实现了最先进性能,时序一致性与感知质量更优,并采用迭代加权训练策略解决多模态不一致问题。
Applying image processing algorithms independently to each video frame often leads to temporal inconsistency in the resulting video. To address this issue, we present a novel and general approach for blind video temporal consistency. Our method is only trained on a pair of original and processed videos directly instead of a large dataset. Unlike most previous methods that enforce temporal consistency with optical flow, we show that temporal consistency can be achieved by training a convolutional network on a video with the Deep Video Prior. Moreover, a carefully designed iteratively reweighted training strategy is proposed to address the challenging multimodal inconsistency problem. We demonstrate the effectiveness of our approach on 7 computer vision tasks on videos. Extensive quantitative and perceptual experiments show that our approach obtains superior performance than state-of-the-art methods on blind video temporal consistency. Our source codes are publicly available at github.com/ChenyangLEI/deep-video-prior.
研究动机与目标
- 解决由独立帧处理图像算法导致的视频时序不一致问题,此类问题常引发闪烁和视觉伪影。
- 开发一种通用框架,可应用于任意图像处理算法,而无需针对特定任务重新训练。
- 消除对光流或显式时序正则化的依赖,转而通过卷积神经网络训练隐式学习视频先验。
- 有效解决多模态不一致问题,即相似帧在多个合理模式下产生不同输出的情况。
- 在与最先进方法相比性能损失最小的前提下,实现高时序一致性。
提出的方法
- 该方法仅使用原始视频和处理后视频作为输入,在单个测试视频上从零开始训练卷积神经网络,无需任何外部数据集。
- 通过训练网络在视频帧间对应空间块上产生一致输出,利用网络架构的归纳偏差来强制实现时序一致性。
- 其核心思想受深度图像先验(DIP)启发,即网络结构本身可作为先验,在过拟合到闪烁伪影之前重建自然视频内容。
- 引入一种迭代加权训练(IRT)策略,通过在帧间选择单一主导模式来解决多模态不一致问题。
- 训练过程在数据保真度与时序一致性之间取得平衡,基于小部分帧的验证结果进行早停。
- 该框架与网络架构无关,可与多种CNN(如U-Net、FCN、ResUnet)结合使用,50帧视频的每帧推理时间约为2秒。
实验结果
研究问题
- RQ1仅在单个视频上进行训练的卷积神经网络,能否在不显式使用光流或变形约束的情况下隐式学习时序一致性?
- RQ2卷积神经网络架构的归纳偏差——特别是其在过拟合到闪烁伪影前重建自然内容的能力——能否被用作时序一致性的深度视频先验?
- RQ3在盲视频处理设置下,如何有效解决相似帧产生不同输出的多模态不一致问题?
- RQ4该方法在无需任务特定适配的情况下,能在多大程度上泛化到多样化的视频处理任务?
- RQ5数据保真度与时序一致性之间的权衡如何?在训练过程中如何有效管理这一权衡?
主要发现
- 所提方法在包括视频着色、去噪和超分辨率在内的七个多样化计算机视觉任务中,均实现了优于最先进方法的时序一致性。
- 迭代加权训练(IRT)策略成功解决了多模态不一致问题,确保帧间选择单一感知一致的模式。
- 时序一致性在训练25至50个周期后趋于稳定,且在不同长度和运动水平的视频上表现良好。
- 该方法无需大规模预训练或外部数据集,仅依赖测试视频进行训练。
- 该方法展现出强大的泛化能力,可有效适配多种CNN架构,包括U-Net、FCN和ResUnet。
- 尽管推理时间较长(例如,50帧视频每帧约2秒),但其感知质量和一致性优于基于光流的基线方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。