Skip to main content
QUICK REVIEW

[论文解读] Real-time Deep Video Deinterlacing

Haichao Zhu, Xueting Liu|arXiv (Cornell University)|Aug 1, 2017
Advanced Image Processing Techniques参考文献 18被引用 8
一句话总结

该论文提出了一种基于深度卷积神经网络(DCNN)的首个实时视频去隔行方法,通过利用奇场和偶场的时序信息,仅重建缺失的扫描线,同时保留原始扫描线。通过采用层共享架构,该方法在单张GPU上实现了实时性能,在多种分辨率下均优于以往方法,在视觉质量和计算效率方面表现更优。

ABSTRACT

Interlacing is a widely used technique, for television broadcast and video recording, to double the perceived frame rate without increasing the bandwidth. But it presents annoying visual artifacts, such as flickering and silhouette "serration," during the playback. Existing state-of-the-art deinterlacing methods either ignore the temporal information to provide real-time performance but lower visual quality, or estimate the motion for better deinterlacing but with a trade-off of higher computational cost. In this paper, we present the first and novel deep convolutional neural networks (DCNNs) based method to deinterlace with high visual quality and real-time performance. Unlike existing models for super-resolution problems which relies on the translation-invariant assumption, our proposed DCNN model utilizes the temporal information from both the odd and even half frames to reconstruct only the missing scanlines, and retains the given odd and even scanlines for producing the full deinterlaced frames. By further introducing a layer-sharable architecture, our system can achieve real-time performance on a single GPU. Experiments shows that our method outperforms all existing methods, in terms of reconstruction accuracy and computational performance.

研究动机与目标

  • 解决现有去隔行方法的局限性:要么忽略时序信息(牺牲质量),要么依赖昂贵的运动估计(牺牲速度)。
  • 克服标准超分辨率DCNN的平移不变性假设,该假设在去隔行中因对现有扫描线与缺失扫描线处理不一致,导致边缘模糊和伪影。
  • 通过利用奇场与偶场之间的时序一致性,实现实时去隔行性能,同时不牺牲视觉质量。
  • 设计一种新型DCNN架构,仅重建缺失扫描线,同时保留输入扫描线,从而提高重建精度。

提出的方法

  • 该方法以整个隔行帧作为输入,输出两个仅包含缺失扫描线的半帧(奇数和偶数),原始扫描线保持不变。
  • 采用双分支DCNN架构,每个分支利用奇场和偶场的特征,分别重建一个缺失的半帧。
  • 低层卷积层在两个分支之间共享,以降低计算成本,并加速训练与推理。
  • 网络通过像素级损失(如L2损失)端到端训练,以最小化缺失扫描线的重建误差。
  • 通过差异化处理现有扫描线与缺失扫描线,避免DCNN的平移不变性假设,从而在物体边界处防止模糊。
  • 模型针对实时推理进行优化,在单张GPU上实现1024×768分辨率下33 fps的性能。

实验结果

研究问题

  • RQ1深度学习模型能否在保留现有扫描线的同时,有效重建隔行视频中的缺失扫描线,并实现实时性能?
  • RQ2与仅使用单场信息的方法相比,结合奇场与偶场时序信息在多大程度上提升了去隔行质量?
  • RQ3双分支网络中层共享策略在多大程度上能降低计算成本,同时不降低重建精度?
  • RQ4避免DCNN中的平移不变性假设是否能带来更好的边缘保持效果并减少去隔行中的伪影?
  • RQ5基于DCNN的去隔行方法能否在视觉质量与速度两方面均优于传统运动估计方法与超分辨率风格方法?

主要发现

  • 所提方法在单张GPU上以1024×768分辨率实现33 fps的实时性能,计算效率全面优于所有对比方法。
  • 平均而言,该方法在PSNR和SSIM指标上均优于所有基线方法,包括微调用于去隔行的SRCNN以及传统方法如ELA和Bicubic。
  • 层共享策略使推理时间减少约三分之二,同时保持几乎相同的重建质量。
  • 该方法显著减少了视觉伪影,如在运动物体轮廓周围出现的模糊和光晕现象。
  • 失败案例出现在极大运动或极细水平结构时,网络可能将隔行伪影误判为真实特征。
  • 该模型在速度与质量上均优于ELA(CPU-based方法),且在重建精度上超越SRCNN及其他超分辨率模型,尽管后者结构更复杂。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。