Skip to main content
QUICK REVIEW

[论文解读] Tencent Video Dataset (TVD): A Video Dataset for Learning-based Visual Data Compression and Analysis

Xiaozhong Xu, Shan Liu|arXiv (Cornell University)|May 12, 2021
Advanced Data Compression Techniques被引用 10
一句话总结

本论文介绍了腾迅视频数据集(TVD),这是一个高质量的视频数据集,包含86个4K(3840×2160)视频序列,每个序列包含65帧,专为基于学习的视觉数据压缩与分析方法的训练和评估而设计。该数据集支持基于神经网络的编码工具以及目标检测与跟踪等机器视觉任务,并为VVC和HEVC编码器提供了性能基准。

ABSTRACT

Learning-based visual data compression and analysis have attracted great interest from both academia and industry recently. More training as well as testing datasets, especially good quality video datasets are highly desirable for related research and standardization activities. Tencent Video Dataset (TVD) is established to serve various purposes such as training neural network-based coding tools and testing machine vision tasks including object detection and tracking. TVD contains 86 video sequences with a variety of content coverage. Each video sequence consists of 65 frames at 4K (3840x2160) spatial resolution. In this paper, the details of this dataset, as well as its performance when compressed by VVC and HEVC video codecs, are introduced.

研究动机与目标

  • 为应对学习型视觉数据压缩与分析研究日益增长的高质量视频数据集需求。
  • 提供一个标准化、多样化且高分辨率的数据集,适用于视频编码和计算机视觉中深度学习模型的训练。
  • 在一致且具代表性的数据集上,实现对现代视频编码器(如VVC和HEVC)的性能评估。
  • 支持基于神经网络的视频压缩工具及目标检测与跟踪等视觉任务的开发与基准测试。
  • 通过提供公开可用、高保真度的数据集,推动视频压缩领域的标准化工作。

提出的方法

  • 该数据集包含86个视频序列,具有统一的4K(3840×2160)空间分辨率,每个序列包含65帧。
  • 通过涵盖各种场景、运动类型和视觉复杂度,确保内容多样性,以支持广泛的应用。
  • 该数据集专为训练用于视频压缩的深度神经网络,以及测试目标检测器和跟踪器等机器视觉模型而设计。
  • 使用两种最先进的编码器——VVC和HEVC,对视频压缩的性能指标进行评估。
  • 该数据集已公开发布,以支持学术与工业研究中的可复现性与基准测试。
  • 该数据集托管于arXiv,并分配了DOI,以实现持久标识与引用。

实验结果

研究问题

  • RQ1当使用VVC和HEVC视频编码器对腾迅视频数据集(TVD)进行压缩时,其表现如何?
  • RQ2TVD的内容多样性与高质量在多大程度上支持基于学习的视频压缩模型的训练与评估?
  • RQ3TVD能否有效作为高分辨率视频中目标检测与跟踪等机器视觉任务的基准?
  • RQ44K分辨率序列的引入如何影响该数据集在现代深度学习应用中的实用性?
  • RQ5TVD在推动视频压缩研究的标准化与可复现性方面发挥何种作用?

主要发现

  • 腾迅视频数据集(TVD)包含86个视频序列,每个序列具有65帧,分辨率为4K(3840×2160),为视频研究提供了大规模且高质量的资源。
  • 由于其高空间分辨率和内容多样性,该数据集在训练基于神经网络的视频压缩工具方面表现出极强的适用性。
  • 性能评估表明,当应用于TVD序列时,VVC在率失真性能上优于HEVC,证实了其最先进的压缩效率。
  • 由于帧质量一致且时间连续性良好,该数据集支持对机器视觉任务(包括目标检测与跟踪)的稳健评估。
  • TVD的可用性使得可复现的基准测试成为可能,推动了视频压缩与视觉分析研究的进展。
  • 该数据集可通过arXiv公开获取,并配有DOI,确保其在学术与工业应用中的长期可用性与可引用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。