[论文解读] How Incomplete is Contrastive Learning? An Inter-intra Variant Dual Representation Method for Self-supervised Video Recognition.
本文提出了一种用于自监督视频识别的双表示方法,通过打乱排序的预训练任务和时间一致性对比损失,显式建模了视频内的方差(clip 内部变化)与视频间的方差(不同视频间的相似性)。该方法在与 SimCLR 结合并在 Kinetics-400 上预训练后,实现了 SOTA 结果,在 UCF101 上达到 82.0% 的准确率,在 UCF101 上的检索准确率达到 46.1%。
Contrastive learning applied to self-supervised representation learning has seen a resurgence in deep models. In this paper, we find that existing contrastive learning based solutions for self-supervised video recognition focus on inter-variance encoding but ignore the intra-variance existing in clips within the same video. We thus propose to learn dual representations for each clip which ( omannumeral 1) encode intra-variance through a shuffle-rank pretext task; ( omannumeral 2) encode inter-variance through a temporal coherent contrastive loss. Experiment results show that our method plays an essential role in balancing inter and intra variances and brings consistent performance gains on multiple backbones and contrastive learning frameworks. Integrated with SimCLR and pretrained on Kinetics-400, our method achieves $ extbf{82.0\%}$ and $ extbf{51.2\%}$ downstream classification accuracy on UCF101 and HMDB51 test sets respectively and $ extbf{46.1\%}$ video retrieval accuracy on UCF101, outperforming both pretext-task based and contrastive learning based counterparts.
研究动机与目标
- 解决当前对比学习方法过度关注视频间方差而忽略视频片段内部方差的问题。
- 通过显式建模同一 clip 不同视图之间的变化,改进自监督视频表示学习。
- 开发一种双表示框架,同时捕捉视频内与视频间方差,以提升特征学习效果。
- 在多种主干网络和对比学习框架上验证所提方法的有效性。
- 在 UCF101、HMDB51 等标准视频识别基准以及视频检索任务上实现 SOTA 性能。
提出的方法
- 该方法为每个 clip 学习双表示:一种通过打乱排序的预训练任务捕捉视频内方差,鼓励模型预测打乱后的 clip 顺序。
- 第二种表示通过时间一致性对比损失编码视频间方差,将同一视频的 clip 拉近,同时与不同视频的 clip 进行对比。
- 打乱排序任务旨在通过打乱 clip 顺序并训练模型预测正确序列,来建模 clip 内部的可变性。
- 通过确保来自同一视频的 clip 在嵌入空间中更接近,来强制实现时间一致性,从而增强结构一致性。
- 双表示通过结合打乱排序损失与对比损失的多任务目标联合优化。
- 该框架与现有对比学习流程兼容,可与 ResNets 等标准架构以及 SimCLR 等框架集成。
实验结果
研究问题
- RQ1显式建模视频 clip 内部方差对自监督视频表示学习有何影响?
- RQ2在多大程度上平衡视频内与视频间方差能提升下游视频识别任务的性能?
- RQ3具有独立不变性建模的双表示学习策略是否能优于标准对比学习在视频识别中的表现?
- RQ4所提方法在标准基准上与现有基于预训练任务和基于对比学习的方法相比表现如何?
- RQ5该方法是否在不同主干网络和对比学习框架上具有泛化能力?
主要发现
- 所提方法在 UCF101 上达到 82.0% 的分类准确率,优于所有基于预训练任务和基于对比学习的基线方法。
- 在 HMDB51 上达到 51.2% 的准确率,表明在多个动作识别基准上均表现出一致的性能提升。
- 在 UCF101 上实现 46.1% 的视频检索准确率,表明其在检索任务中具有高质量的特征表示。
- 性能增益在多种主干网络和对比学习框架中保持一致,证实了该方法的泛化能力。
- 消融实验表明,平衡视频内与视频间方差至关重要,双表示策略显著优于仅关注视频间方差的模型。
- 打乱排序预训练任务有效捕捉了视频内方差,时间一致性对比损失增强了视频间方差的建模,验证了设计选择的合理性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。