Skip to main content
QUICK REVIEW

[论文解读] Video Jigsaw: Unsupervised Learning of Spatiotemporal Context for Video Action Recognition

Unaiza Ahsan, Rishi Madhok|arXiv (Cornell University)|Aug 22, 2018
Human Pose and Action Recognition参考文献 52被引用 5
一句话总结

本文提出 Video Jigsaw,一种自监督方法,通过训练网络解决由多帧视频图像块组成的拼图,联合学习视频中的空间与时间上下文。无需目标跟踪或光流,该模型在 HMDB51 上达到最先进性能,在 UCF101 和 PASCAL VOC 上取得具有竞争力的结果,证明了从 Kinetics 预训练中实现强大的零样本迁移能力。

ABSTRACT

We propose a self-supervised learning method to jointly reason about spatial and temporal context for video recognition. Recent self-supervised approaches have used spatial context [9, 34] as well as temporal coherency [32] but a combination of the two requires extensive preprocessing such as tracking objects through millions of video frames [59] or computing optical flow to determine frame regions with high motion [30]. We propose to combine spatial and temporal context in one self-supervised framework without any heavy preprocessing. We divide multiple video frames into grids of patches and train a network to solve jigsaw puzzles on these patches from multiple frames. So the network is trained to correctly identify the position of a patch within a video frame as well as the position of a patch over time. We also propose a novel permutation strategy that outperforms random permutations while significantly reducing computational and memory constraints. We use our trained network for transfer learning tasks such as video activity recognition and demonstrate the strength of our approach on two benchmark video action recognition datasets without using a single frame from these datasets for unsupervised pretraining of our proposed video jigsaw network.

研究动机与目标

  • 开发一种自监督视频表征学习方法,联合利用空间与时间上下文,且无需复杂预处理。
  • 消除对目标跟踪或光流的依赖,以挖掘视频中与运动相关的图像块。
  • 设计一种高效的拼图排列策略,保持空间与时间的一致性,同时降低内存与计算开销。
  • 评估所学表征在下游视频动作识别与图像分类任务中的迁移能力。
  • 证明仅使用大规模未标注视频数据并辅以简单的图像块采样,即可获得强大的视频理解表征。

提出的方法

  • 该方法将多帧视频划分为空间图像块网格,并通过在时空维度上重新排列这些图像块来构建拼图。
  • 训练一个深度神经网络,以预测每个图像块在打乱拼图中的原始空间与时间位置。
  • 提出一种新型约束排列策略,生成多样化且内存高效的排列,同时保持局部空间与时间一致性。
  • 使用仅包含 RGB 帧的大型视频数据集(如 Kinetics)对网络进行预训练,无需任何动作标签。
  • 通过在下游视频动作识别基准(如 UCF101 与 HMDB51)上微调预训练网络,应用迁移学习。
  • 同时在图像分类任务(PASCAL VOC 2007)上评估模型,以评估从视频预训练中实现的零样本泛化能力。

实验结果

研究问题

  • RQ1自监督学习框架是否能在无需目标跟踪或光流的情况下,联合利用视频中的空间与时间上下文?
  • RQ2在视频图像块上进行拼图任务是否能学习到泛化能力良好的表征,以应用于下游视频动作识别任务?
  • RQ3与随机排列相比,约束排列策略是否能在视频拼图学习中提升性能与效率?
  • RQ4在 Kinetics 上预训练的模型在 UCF101 与 HMDB51 等规模较小且动作更丰富的数据集上泛化能力如何?
  • RQ5在未进行任何图像特定预训练的情况下,视频预训练模型是否能在图像分类任务上表现具有竞争力?

主要发现

  • 在微调后,Video Jigsaw 模型在 HMDB51 数据集上达到 63.6% 的 top-1 准确率,优于该基准上所有先前的无监督预训练方法。
  • 在 UCF101 上,模型取得 85.2% 的准确率,与无监督预训练方法中的最先进水平相当。
  • 模型在图像分类任务上表现出色,PASCAL VOC 2007 上达到 63.6% 的 mAP,优于大多数基于视频的半监督方法。
  • 所提出的约束排列策略能够高效生成多样化排列,并在性能上优于随机排列,尤其在使用 12 个图像块时优势更明显。
  • 该模型仅使用 Kinetics 视频中每段 3 帧即可取得优异结果,表明大规模未标注视频数据本身已足够用于有效的自监督学习。
  • 所学特征展现出有意义的归纳偏置,早期卷积滤波器的可视化结果揭示了方向性边缘检测器,表明无监督条件下实现了结构化的特征学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。