Skip to main content
QUICK REVIEW

[论文解读] Non-Local ConvLSTM for Video Compression Artifact Reduction

Yi Xu, Longwen Gao|arXiv (Cornell University)|Oct 27, 2019
Advanced Image Processing Techniques参考文献 50被引用 7
一句话总结

本文提出 NL-ConvLSTM,一种端到端深度学习框架,通过利用多个前后帧来减少视频压缩伪影,而无需显式运动估计。通过将近似非局部机制与 ConvLSTM 相结合,该方法高效捕捉长程时空依赖性,在 HEVC 和 H.264 压缩视频上实现最先进性能,显著提升视觉质量和时间一致性。

ABSTRACT

Video compression artifact reduction aims to recover high-quality videos from low-quality compressed videos. Most existing approaches use a single neighboring frame or a pair of neighboring frames (preceding and/or following the target frame) for this task. Furthermore, as frames of high quality overall may contain low-quality patches, and high-quality patches may exist in frames of low quality overall, current methods focusing on nearby peak-quality frames (PQFs) may miss high-quality details in low-quality frames. To remedy these shortcomings, in this paper we propose a novel end-to-end deep neural network called non-local ConvLSTM (NL-ConvLSTM in short) that exploits multiple consecutive frames. An approximate non-local strategy is introduced in NL-ConvLSTM to capture global motion patterns and trace the spatiotemporal dependency in a video sequence. This approximate strategy makes the non-local module work in a fast and low space-cost way. Our method uses the preceding and following frames of the target frame to generate a residual, from which a higher quality frame is reconstructed. Experiments on two datasets show that NL-ConvLSTM outperforms the existing methods.

研究动机与目标

  • 为解决现有方法仅依赖单帧或成对邻近帧的局限性,这些方法可能遗漏低质量帧中的高质量细节。
  • 建模多个连续帧之间的长程时空依赖性,以改善压缩视频中的伪影消除效果。
  • 开发一种高效、低内存消耗的近似非局部机制替代方案,适用于实时视频增强。
  • 在不同视频压缩标准(包括 HEVC 和 H.264)上实现鲁棒性能。
  • 在提升视觉质量的同时保持时间一致性,减少重建视频序列中的质量波动。

提出的方法

  • 提出一种新颖的端到端深度神经网络 NL-ConvLSTM,结合 ConvLSTM 与近似非局部机制,以建模多帧之间的时空依赖性。
  • 引入一种近似非局部策略,高效计算帧间像素级相似性,相比精确非局部操作显著降低计算与内存开销。
  • 将目标帧的前后帧作为输入,生成残差并加到压缩帧上,以重建更高画质输出。
  • 采用残差学习框架,使网络学习压缩帧与真实高画质帧之间的差异。
  • 设计一种轻量化、可微分模块,避免显式运动估计与补偿,支持端到端直接训练。
  • 采用多帧上下文聚合策略,捕捉全局运动模式,并在低画质帧中识别隐藏的高质量区域。

实验结果

研究问题

  • RQ1与仅依赖单帧或成对邻近帧的方法相比,建模多个连续帧(超过一两个邻居)是否能提升视频压缩伪影消除效果?
  • RQ2在无显式运动估计或补偿的情况下,如何有效建模压缩视频序列中的全局时空依赖性?
  • RQ3近似非局部机制是否能在显著降低计算与内存开销的同时,实现与精确非局部操作相当的性能?
  • RQ4所提方法是否能在 HEVC 和 H.264 等不同视频压缩标准上实现良好泛化?
  • RQ5该方法在多大程度上提升了时间一致性,并减少了重建视频序列中的质量波动?

主要发现

  • NL-ConvLSTM 在两个基准数据集上实现最先进性能,在 PSNR 和 SSIM 指标上均优于现有方法。
  • 在 Vimeo-90K 数据集上,对于 QP=37 的 H.264 压缩视频,PSNR 提升 1.43 dB,SSIM 提升 0.011,表明其在不同编码器间具有强大泛化能力。
  • 与基线方法和 MFQE 相比,该方法更有效地减少质量波动,PSNR 标准差为 1.036 dB,PVD 为 1.038 dB,表明时间一致性显著提升。
  • 定性结果表明,与 ARCNN、DnCNN、DSCNN 和 MFQE 相比,NL-ConvLSTM 更好地保留了细节,并减少了方块效应、蚊虫噪声和振铃伪影。
  • 运行时分析显示,近似 NL-ConvLSTM 在 1920×1080 分辨率下每帧耗时 2.6 秒,远快于原始非局部版本(6738 毫秒),具备实时应用潜力。
  • 视觉对比显示,即使在整体画质较低的帧中,该方法仍能成功恢复高质量区域,目标帧在局部质量指标上优于其邻近帧。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。