Skip to main content
QUICK REVIEW

[论文解读] A Compressive Sensing Video dataset using Pixel-wise coded exposure

Sathyaprakash Narayanan, Yeshwanth Bethi|arXiv (Cornell University)|May 24, 2019
Sparse and Compressive Sensing Techniques参考文献 9被引用 4
一句话总结

本论文提出了首个通过像素级编码曝光实现压缩感知的视频数据集,实现了视频数据的高效存储与处理,同时保留了目标跟踪与定位能力。通过利用稀疏性与非相干性原理,将K帧合并为单个压缩帧,该数据集支持在压缩数据上直接进行端到端的目标检测、跟踪与重建研究,且通过基于YOLO的伪标签方法,极大减少了人工标注工作量。

ABSTRACT

Manifold amount of video data gets generated every minute as we read this document, ranging from surveillance to broadcasting purposes. There are two roadblocks that restrain us from using this data as such, first being the storage which restricts us from only storing the information based on the hardware constraints. Secondly, the computation required to process this data is highly expensive which makes it infeasible to work on them. Compressive sensing(CS)[2] is a signal process technique[11], through optimization, the sparsity of a signal can be exploited to recover it from far fewer samples than required by the Shannon-Nyquist sampling theorem. There are two conditions under which recovery is possible. The first one is sparsity which requires the signal to be sparse in some domain. The second one is incoherence which is applied through the isometric property which is sufficient for sparse signals[9][10]. To sustain these characteristics, preserving all attributes in the uncompressed domain would help any kind of in this field. However, existing dataset fallback in terms of continuous tracking of all the object present in the scene, very few video datasets have comprehensive continuous tracking of objects. To address these problems collectively, in this work we propose a new comprehensive video dataset, where the data is compressed using pixel-wise coded exposure [3] that resolves various other impediments.

研究动机与目标

  • 为应对因高存储与计算成本导致的海量视频数据存储与处理挑战。
  • 克服现有视频数据集缺乏连续目标跟踪以及场景中所有目标全面标注的局限性。
  • 创建一个用于视频压缩感知的新基准数据集,支持直接在压缩帧上处理,无需完整重建。
  • 通过以特定方式嵌入运动信息,实现隐私保护的视频分析,使未经授权用户无法辨识内容。
  • 为未来基于压缩感知的低复杂度、高效率视频处理研究奠定基础。

提出的方法

  • 通过在不同运动条件下(静态目标伴随移动背景、移动目标伴随静态背景、目标与背景均移动)拍摄单个物体(人物与汽车)的灰度视频来构建数据集。
  • 采用像素级编码曝光将K帧连续帧压缩为单个压缩帧,利用信号稀疏性与非相干性实现重建。
  • 使用预训练的YOLO v3模型为每帧生成初始边界框,随后通过最小/最大坐标池化方法在压缩域内将这些边界框合并为更大的边界框。
  • 采用伪标签方法以减少人工标注工作量:在VATIC中对YOLO生成的边界框进行人工校正,以生成压缩帧的高质量真实标签。
  • 数据以NPZ格式存储以实现高效数组存储,以JSON格式存储结构化标签元数据,包括类别ID、帧编号及边界框坐标。
  • 数据集包含284段汽车视频片段与91段人物视频片段,总计约90分钟的视频,涵盖多样的长宽比与运动动态。

实验结果

研究问题

  • RQ1通过像素级编码曝光压缩的视频数据集是否能在无需完整重建的情况下支持准确的目标检测与跟踪?
  • RQ2使用YOLO v3进行伪标签生成在压缩感知领域中生成真实标签的效率如何?
  • RQ3像素级编码曝光在多大程度上保留了压缩帧中目标定位所必需的空间与时间信息?
  • RQ4基于压缩感知的视频数据集是否能在降低计算与存储成本的同时,保持对跟踪与识别等下游任务的实用性?
  • RQ5包含多样化运动模式(目标与背景同时运动)是否会影响直接在压缩帧上运行的算法性能?

主要发现

  • 该数据集包含284段汽车视频片段与91段人物视频片段,总计约90分钟的灰度视频,涵盖多样的运动动态与长宽比。
  • 使用YOLO v3进行伪标签处理显著减少了人工标注工作量,且在VATIC中的人工验证提升了边界框的紧凑性并检测出漏检目标。
  • 将K帧的边界框在压缩帧中合并为单个更大的边界框,实现了压缩域内的一致性定位与跟踪。
  • 采用像素级编码曝光可实现压缩率K,将存储与处理需求降低K倍,同时保留了运动与目标结构信息。
  • 该数据集是首个专注于视频压缩感知的专用数据集,为低复杂度、隐私保护的视频分析研究提供了基础。
  • 未来版本将包含更高的压缩率、更密集的视频内容,以及额外的标注信息,如语义分割与姿态估计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。