Skip to main content
QUICK REVIEW

[论文解读] CSVideoNet: A Real-time End-to-end Learning Framework for High-frame-rate Video Compressive Sensing

Kai Xu, Fengbo Ren|arXiv (Cornell University)|Dec 15, 2016
Sparse and Compressive Sensing Techniques参考文献 43被引用 13
一句话总结

CSVideoNet 提出了一种实时、端到端的深度学习框架,用于高速率视频压缩感知,通过多速率卷积神经网络(CNN)和合成长短时记忆网络(LSTM)直接学习逆映射,绕过了迭代重建。该方法在单张 GPU 上实现了 100× 压缩比下 25 dB 的 PSNR 和 125 fps 的重建速度,相比最先进方法在速度上提升了三个数量级,并显著改善了质量-压缩比权衡。

ABSTRACT

This paper addresses the real-time encoding-decoding problem for high-frame-rate video compressive sensing (CS). Unlike prior works that perform reconstruction using iterative optimization-based approaches, we propose a non-iterative model, named "CSVideoNet". CSVideoNet directly learns the inverse mapping of CS and reconstructs the original input in a single forward propagation. To overcome the limitations of existing CS cameras, we propose a multi-rate CNN and a synthesizing RNN to improve the trade-off between compression ratio (CR) and spatial-temporal resolution of the reconstructed videos. The experiment results demonstrate that CSVideoNet significantly outperforms the state-of-the-art approaches. With no pre/post-processing, we achieve 25dB PSNR recovery quality at 100x CR, with a frame rate of 125 fps on a Titan X GPU. Due to the feedforward and high-data-concurrency natures of CSVideoNet, it can take advantage of GPU acceleration to achieve three orders of magnitude speed-up over conventional iterative-based approaches. We share the source code at https://github.com/PSCLab-ASU/CSVideoNet.

研究动机与目标

  • 解决高速率视频压缩感知中的实时解码瓶颈问题,因为传统迭代方法速度过慢,难以实际应用。
  • 克服现有压缩感知相机的局限,提升压缩比(CR)与时空分辨率之间的权衡。
  • 开发一种端到端、非迭代的深度学习框架,直接将压缩视频测量映射为高质量原始帧,无需预处理或后处理。
  • 通过新颖的架构实现时空特征学习,以在高压缩比下提升重建保真度。
  • 在硬件资源受限的环境中,实现基于 GPU 加速的前馈推理,以支持实时部署。

提出的方法

  • 提出多速率 CNN,以在不同分辨率下提取分层空间特征,实现高效压缩与高空间保真度。
  • 集成一种合成循环神经网络(LSTM),以隐式估计运动并建模视频帧之间的时序依赖性。
  • 设计一种端到端、前馈的深度神经网络,通过单次前向传播直接学习从压缩测量到原始视频帧的逆映射。
  • 采用联合优化策略,联合训练空间与时序特征提取路径,以提升高压缩比下的重建质量。
  • 采用数据驱动、无需稀疏性先验的方法,通过直接从大规模未标注视频数据中学习逆映射,绕过迭代优化。
  • 通过利用深度网络架构的高数据并发性和前馈特性,实现高吞吐量推理,借助 GPU 加速。

实验结果

研究问题

  • RQ1基于深度学习的非迭代框架能否实现在高压缩比下对高速率视频压缩感知的实时重建?
  • RQ2与传统方法相比,联合时空特征学习在压缩比与重建质量权衡方面有何改进?
  • RQ3通过 LSTM 实现的隐式运动估计在多大程度上提升了重建保真度,尤其是在高压缩比下?
  • RQ4所提出的框架能否在不使用稀疏性先验的前提下,同时在重建质量和速度上超越基于迭代优化的压缩感知方法?
  • RQ5在实际高速率视频采集场景中,该模型对传感器噪声的鲁棒性如何?

主要发现

  • CSVideoNet 在单张 Titan X GPU 上实现了 100× 压缩比下 25 dB 的 PSNR 和 125 fps 的重建速度,证明了其实现实时性能。
  • 在 100× 压缩比下,模型以 8 ms(即 125 fps)完成对 160×160 视频帧的重建,比 D-AMP 和 MC-BCS 等迭代方法快三个数量级。
  • 引入 LSTM 网络后,PSNR 最高提升 4 dB,证明了时序建模的重要性。
  • 在 100× 压缩比下,CSVideoNet 达到 24.23 dB 的 PSNR 和 0.74 的 SSIM,优于所有基线方法,包括 VCSNet 和 ReconNet。
  • 在噪声环境下,模型表现出高度鲁棒性,在 SNR 为 20 dB、40 dB 和 60 dB 的条件下,PSNR 均持续高于参考方法。
  • 性能提升主要归因于联合时空特征学习,而非模型规模本身,因为仅使用更大 CNN 而无 LSTM 的模型改进微乎其微。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。