Skip to main content
QUICK REVIEW

[论文解读] Memory-Efficient Network for Large-scale Video Compressive Sensing

Ziheng Cheng, Bo Chen|arXiv (Cornell University)|Mar 4, 2021
Sparse and Compressive Sensing Techniques参考文献 51被引用 8
一句话总结

该论文提出RevSCI-net,一种内存高效的端到端可逆3D卷积神经网络,用于大规模视频压缩感知重建。通过利用多组可逆3D卷积,该方法在显著降低内存使用的同时,实现了对高分辨率视频(例如512×512×50)的训练与推理——在压缩率为50时达到最先进性能,包括在真实世界SCI相机数据上表现优异,且为首个能够处理此类大规模问题的深度学习模型。

ABSTRACT

Video snapshot compressive imaging (SCI) captures a sequence of video frames in a single shot using a 2D detector. The underlying principle is that during one exposure time, different masks are imposed on the high-speed scene to form a compressed measurement. With the knowledge of masks, optimization algorithms or deep learning methods are employed to reconstruct the desired high-speed video frames from this snapshot measurement. Unfortunately, though these methods can achieve decent results, the long running time of optimization algorithms or huge training memory occupation of deep networks still preclude them in practical applications. In this paper, we develop a memory-efficient network for large-scale video SCI based on multi-group reversible 3D convolutional neural networks. In addition to the basic model for the grayscale SCI system, we take one step further to combine demosaicing and SCI reconstruction to directly recover color video from Bayer measurements. Extensive results on both simulation and real data captured by SCI cameras demonstrate that our proposed model outperforms previous state-of-the-art with less memory and thus can be used in large-scale problems. The code is at https://github.com/BoChenGroup/RevSCI-net.

研究动机与目标

  • 解决基于深度学习的大规模视频压缩感知(SCI)重建中的高内存与计算成本问题。
  • 在GPU内存有限的条件下,实现在高分辨率视频数据(如FHD及以上)上的端到端训练与推理。
  • 将去马赛克与SCI重建整合到单一端到端网络中,实现从拜耳滤波测量中直接恢复彩色视频。
  • 在最小化GPU内存消耗的同时,实现最先进的重建质量与速度,以应对大规模SCI问题。

提出的方法

  • 该方法采用可逆3D卷积神经网络(RevSCI-net),通过使用可逆残差块,在训练过程中避免存储激活值。
  • 采用多组可逆3D卷积,通过参数共享与可逆变换,在保持内存效率的同时增强特征表示能力。
  • 网络端到端训练,从单次快照压缩测量中重建3D视频体(时空数据)。
  • 提出一种新型架构,将去马赛克与SCI重建结合为单一网络,实现从拜耳滤波原始测量中直接恢复RGB视频。
  • 可逆设计确保反向传播过程中无需存储激活值,从而大幅降低训练时的内存占用。
  • 该模型在模拟与真实世界SCI数据集上均进行了评估,包括由物理SCI相机捕获的大规模数据(512×512×50)。

实验结果

研究问题

  • RQ1基于深度学习的重建方法是否能在保持内存高效的同时,实现从大规模压缩测量中高质量的视频恢复?
  • RQ2将去马赛克与SCI重建整合到单一端到端网络中,对彩色视频恢复性能有何影响?
  • RQ3可逆3D CNN架构在大规模视频SCI中在不牺牲重建质量的前提下,能在多大程度上减少内存消耗?
  • RQ4所提方法是否能在真实世界高分辨率SCI数据上,同时超越现有最先进方法的重建质量与推理速度?
  • RQ5在单张GPU上,使用内存高效的架构训练与部署FHD级别视频(1920×1080×24)的深度学习模型是否可行?

主要发现

  • 在512×512×50真实数据集上,RevSCI-net的PSNR达到33.84,SSIM达到0.956,优于BIRNAT与DeSCI,在质量和内存效率方面均表现更优。
  • 该模型以仅1350 MB的内存占用重建512×512×50视频,远低于BIRNAT的48000 MB,使其可在单张48GB GPU上训练。
  • 在真实数据(如多米诺骨牌与水球)上,RevSCI-net生成的运动轮廓更清晰,细节更分明,优于DeSCI(过度平滑)与GAP-TV(噪声明显)。
  • 该模型对1920×1080×24视频的重建时间仅为12.46秒,远快于DeSCI(超过3.5小时),且在小分辨率下可在数秒内完成。
  • 由于其可逆架构,RevSCI-net是首个可在单张GPU上处理FHD级别SCI数据(1920×1080×24)的端到端深度学习模型。
  • 消融研究证实,增加可逆块数量可提升重建质量,而增加组数则可在不增加激活内存的前提下增强特征层级变换能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。