Skip to main content
QUICK REVIEW

[论文解读] Back to the Future: Cycle Encoding Prediction for Self-supervised Contrastive Video Representation Learning

Xinyu Yang, Majid Mirmehdi|Explore Bristol Research|Oct 14, 2020
Human Pose and Action Recognition参考文献 56被引用 5
一句话总结

本文提出循环编码预测(Cycle Encoding Prediction, CEP),一种自监督视频表征学习方法,通过在潜在特征空间中强制双向时间循环闭合来提升动作识别性能。通过联合优化循环一致性与对比特征分离,使用共享编码器和双预测头,CEP在UCF101和HMDB51数据集上达到最先进性能,准确率相比基线方法最高提升3.9%。

ABSTRACT

In this paper we show that learning video feature spaces in which temporal cycles are maximally predictable benefits action classification. In particular, we propose a novel learning approach termed Cycle Encoding Prediction (CEP) that is able to effectively represent high-level spatio-temporal structure of unlabelled video content. CEP builds a latent space wherein the concept of closed forward-backward as well as backward-forward temporal loops is approximately preserved. As a self-supervision signal, CEP leverages the bi-directional temporal coherence of the video stream and applies loss functions that encourage both temporal cycle closure as well as contrastive feature separation. Architecturally, the underpinning network structure utilises a single feature encoder for all video snippets, adding two predictive modules that learn temporal forward and backward transitions. We apply our framework for pretext training of networks for action recognition tasks. We report significantly improved results for the standard datasets UCF101 and HMDB51. Detailed ablation studies support the effectiveness of the proposed components. We publish source code for the CEP components in full with this paper.

研究动机与目标

  • 开发一种自监督学习方法,利用未剪辑视频中的内在时间结构,以改善视频表征学习。
  • 解决在无人工标注标签的情况下学习语义有意义且时间连贯的特征空间的挑战。
  • 提出一种基于时间循环闭合的新颖掩码任务,以增强视频嵌入的泛化能力与特征质量。
  • 探究循环一致性作为自监督信号,在对比现有帧级预测或基于追踪的方法时的有效性。
  • 评估记忆库、归一化技术及光流增强等架构组件对模型性能的影响。

提出的方法

  • CEP使用单一共享视频编码器将视频片段映射到潜在空间,其中通过两个独立的头部预测正向与反向时间转换。
  • 通过最小化损失函数强制实现循环一致性,该损失函数鼓励预测形成闭合回路:从过去预测未来,再从未来反向预测过去,应能恢复原始的过去状态。
  • 并行应用对比损失,以确保语义相似的片段在潜在空间中彼此靠近,而语义不同的片段则被相互推开。
  • 使用记忆库在对比学习过程中存储负样本特征,从而实现更大的有效批量大小并提升表征质量。
  • 引入同步时间组归一化(Synchronized Temporal-Group Normalization, Sync-TGN),通过减少时间组之间的信息泄露,防止出现平凡解。
  • 以一种模糊片段间运动的方式增强光流,增加循环预测任务的难度,从而提升模型鲁棒性。

实验结果

研究问题

  • RQ1在潜在特征空间中强制实现双向时间循环闭合是否能改善视频表征学习以用于动作识别?
  • RQ2与未来帧预测或基于帧级相似性的对比学习等其他自监督信号相比,循环一致性表现如何?
  • RQ3记忆库、Sync-TGN和光流增强等架构组件对CEP框架整体性能的贡献是什么?
  • RQ4时间感受野长度是否会影响CEP中学习到的表征质量?
  • RQ5CEP在不同主干网络架构和数据集上的泛化能力如何?

主要发现

  • 与无循环一致性的基线相比,CEP在UCF101上的top-1准确率提升3.9%,证明了所提自监督信号的有效性。
  • 循环一致性损失($\mathcal{L}_C$)在整个预训练过程中持续提升性能,准确率增益从179K步时的2.1%提升至537K步时的5.4%。
  • 在数据增强过程中对片段间光流进行模糊处理,使224×224分辨率下的性能提升5.1%,表明对运动线索的鲁棒性显著增强。
  • 使用高动量因子的动态记忆库相比静态或无记忆库的设置性能更优,证实其在对比学习中的价值。
  • 与标准批量归一化相比,同步时间组归一化(Sync-TGN)使准确率提升3.6%,有效降低了平凡解的风险。
  • 将时间感受野从1.5秒增加到3秒,性能提升1.7%,表明更长的上下文有助于学习语义动态。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。