Skip to main content
QUICK REVIEW

[论文解读] Skip-Clip: Self-Supervised Spatiotemporal Representation Learning by Future Clip Order Ranking

Alaaeldin El-Nouby, Shuangfei Zhai|arXiv (Cornell University)|Oct 28, 2019
Human Pose and Action Recognition参考文献 21被引用 12
一句话总结

Skip-Clip 提出了一种自监督时空表征学习方法,通过训练3D CNN来根据上下文片段对未来的视频片段进行排序,利用时间连贯性,而无需进行完整帧的预测。该方法在UCF101动作识别任务上达到了64.4%的top-1准确率,相比随机初始化提升了51.8%,并超越了ImageNet微调权重,证明了其强大的迁移能力,并与当前最先进自监督方法具有竞争力。

ABSTRACT

Deep neural networks require collecting and annotating large amounts of data to train successfully. In order to alleviate the annotation bottleneck, we propose a novel self-supervised representation learning approach for spatiotemporal features extracted from videos. We introduce Skip-Clip, a method that utilizes temporal coherence in videos, by training a deep model for future clip order ranking conditioned on a context clip as a surrogate objective for video future prediction. We show that features learned using our method are generalizable and transfer strongly to downstream tasks. For action recognition on the UCF101 dataset, we obtain 51.8% improvement over random initialization and outperform models initialized using inflated ImageNet parameters. Skip-Clip also achieves results competitive with state-of-the-art self-supervision methods.

研究动机与目标

  • 为解决视频标注的高昂成本,开发一种利用视频中时间连贯性的自监督方法。
  • 克服现有帧序排列和未来预测掩蔽任务的局限性,这些任务可能因循环或对称动作而产生模糊或噪声的监督信号。
  • 通过结合上下文感知排序与旋转预测、对比学习等辅助目标,提升学习表征的泛化能力。
  • 仅使用未标注视频数据进行预训练,证明其在下游动作识别任务中的强大迁移性能。
  • 表明一种简单、上下文条件化的排序目标可在不依赖Kinetics等大规模预训练数据集的情况下,取得具有竞争力的结果。

提出的方法

  • 该方法从视频中采样一个上下文片段和一组未来片段,然后训练3D CNN基于上下文对未来的片段进行相对顺序排序。
  • 使用排序目标来预测每个未来片段的正确相对位置,从而促使模型学习时间动态和运动模式。
  • 在目标编码器中添加一个辅助的旋转预测头,以提升特征质量并防止出现平凡解。
  • 在正样本(未来片段)与来自其他片段的负样本之间应用对比损失,以增强特征的判别能力。
  • 使用标准的监督训练方式,结合全局平均池化和Softmax分类器,对上下文片段编码器进行微调以用于下游动作识别任务。
  • 模型采用3D ResNet-18骨干网络,输入16帧的112×112裁剪片段,并使用Adam优化器和学习率衰减进行训练。

实验结果

研究问题

  • RQ1基于上下文片段对未来的视频片段进行排序的自监督掩蔽任务,是否能比随机初始化或ImageNet初始化产生更具泛化能力的时空表征?
  • RQ2将上下文感知排序与旋转预测、对比学习等辅助目标结合,是否能提升表征质量和下游性能?
  • RQ3与依赖帧序排列或未来预测的其他自监督方法相比,Skip-Clip在应对模糊时间模式方面是否更具鲁棒性?
  • RQ4在小规模数据集(如UCF101)上预训练的方法能否达到与在大规模数据集(如Kinetics)上预训练的模型相当的性能?
  • RQ5与标准的帧序排列或未来预测任务相比,所提出的基于排序的方法在多大程度上减少了监督信号的模糊性?

主要发现

  • Skip-Clip在UCF101动作识别任务上达到64.4%的top-1准确率,相比从随机初始化训练的模型提升了51.8%。
  • 该方法优于使用ImageNet微调权重初始化的模型,而后者通常是视频表征学习中的强基线。
  • 添加旋转辅助目标使性能提升3.6%,表明其在防止平凡解和提升特征质量方面具有重要作用。
  • 结合旋转和对比损失的完整模型达到64.4%的准确率,优于所有基于2D CNN的自监督方法,并与最先进方法具有竞争力。
  • 尽管仅使用UCF101进行预训练,Skip-Clip的性能与3DCubicPuzzles相当,且在相同数据集上比较时,优于使用Kinetics预训练的方法。
  • 消融实验表明,排序、旋转和对比学习的组合对最优性能至关重要,各组件均对最终结果有显著贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。