Skip to main content
QUICK REVIEW

[论文解读] Exploring Temporally Dynamic Data Augmentation for Video Recognition

Taeoh Kim, Jin-Hyung Kim|arXiv (Cornell University)|Jun 30, 2022
Human Pose and Action Recognition被引用 5
一句话总结

本文提出 DynaAugment,一种用于视频识别的时序动态数据增强框架,利用傅里叶采样在视频帧之间生成平滑、多样且逼真的时序增强幅度变化。该方法在多种视频识别任务和数据集上显著提升性能,在 UCF-101 上相比静态增强基线最高提升 13.3% 的 top-1 准确率,并在损坏视频上表现出更强的鲁棒性。

ABSTRACT

Data augmentation has recently emerged as an essential component of modern training recipes for visual recognition tasks. However, data augmentation for video recognition has been rarely explored despite its effectiveness. Few existing augmentation recipes for video recognition naively extend the image augmentation methods by applying the same operations to the whole video frames. Our main idea is that the magnitude of augmentation operations for each frame needs to be changed over time to capture the real-world video's temporal variations. These variations should be generated as diverse as possible using fewer additional hyper-parameters during training. Through this motivation, we propose a simple yet effective video data augmentation framework, DynaAugment. The magnitude of augmentation operations on each frame is changed by an effective mechanism, Fourier Sampling that parameterizes diverse, smooth, and realistic temporal variations. DynaAugment also includes an extended search space suitable for video for automatic data augmentation methods. DynaAugment experimentally demonstrates that there are additional performance rooms to be improved from static augmentations on diverse video models. Specifically, we show the effectiveness of DynaAugment on various video datasets and tasks: large-scale video recognition (Kinetics-400 and Something-Something-v2), small-scale video recognition (UCF- 101 and HMDB-51), fine-grained video recognition (Diving-48 and FineGym), video action segmentation on Breakfast, video action localization on THUMOS'14, and video object detection on MOT17Det. DynaAugment also enables video models to learn more generalized representation to improve the model robustness on the corrupted videos.

研究动机与目标

  • 为解决静态数据增强在视频识别中的局限性,其无法建模真实世界中的时序变化(如相机运动或光照变化)。
  • 开发一种简单而有效的框架,随时间动态变化增强幅度,提升模型泛化能力和鲁棒性。
  • 在最大化时序增强模式多样性与真实感的同时,减少超参数复杂度。
  • 扩展现有自动增强搜索空间,以更好地适应视频特有的特性,包括时序动态性。
  • 在多种视频识别任务(包括动作识别、分割、定位和检测)上验证动态增强的有效性。

提出的方法

  • 提出傅里叶采样作为参数化函数,通过组合正弦基函数与随机频率和振幅,生成时序动态的增强幅度。
  • 引入统一的、可微的机制,按帧控制增强操作的幅度,确保时序演变的平滑与真实。
  • 将自动增强方法(如 RandAugment、TrivialAugment)的搜索空间扩展,纳入视频特有操作,如时序裁剪、帧删除和时间扭曲。
  • 采用可微搜索策略,联合优化增强策略与时序动态,实现端到端训练,且额外超参数极少。
  • 在下游任务中使用 3D 视频主干网络(如 Swin-Tiny)评估泛化与鲁棒性,替代标准图像主干网络。
  • 采用亲和性与多样性等定量指标分析增强数据质量,确保分布偏移最小化,同时最大化独特训练样本数。

实验结果

研究问题

  • RQ1与静态增强相比,时序动态增强是否能显著提升视频识别性能?
  • RQ2如何利用参数化、可微函数有效建模真实视频中的时序变化(如相机运动或光照变化)?
  • RQ3使用傅里叶采样生成动态增强幅度是否能带来在分布外数据和损坏视频上的更好泛化与鲁棒性?
  • RQ4所提出的 DynaAugment 框架在多种视频识别任务(包括动作识别、分割、定位和检测)上的性能提升程度如何?
  • RQ5DynaAugment 的性能增益源于增强的动态特性,还是仅仅因为扩展了搜索空间?

主要发现

  • 与静态 RandAugment 基线相比,DynaAugment 在 UCF-101 上将 top-1 准确率提升 13.3 个百分点,达到 85.3% 的 top-1 准确率。
  • 在 Diving-48 数据集上,DynaAugment 达到 72.5% 的 top-1 准确率,优于静态版本(68.3%)及其他动态变体(如线性或正弦)。
  • 该方法降低了重复实验中性能的标准差,表明相比基线和 TrivialAugment,训练稳定性与鲁棒性得到提升。
  • DynaAugment 在损坏视频上表现出更优的泛化能力,尤其在高比特率压缩下,显示出对分布偏移更强的鲁棒性。
  • 消融研究证实,性能提升的关键原因在于时序动态性,而非搜索空间修改,因为 DynaAugment 即使在宽搜索空间基线上也表现更优。
  • 亲和性与多样性指标显示,DynaAugment 生成的增强数据与干净数据具有高度分布相似性(亲和性 = 0.96)且多样性高(1.59),表明其训练数据既真实又多样化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。