Skip to main content
QUICK REVIEW

[论文解读] Probabilistic Representations for Video Contrastive Learning

Jungin Park, Jiyoung Lee|arXiv (Cornell University)|Apr 8, 2022
Human Pose and Action Recognition被引用 5
一句话总结

该论文提出ProViCo,一种自监督视频表征学习方法,通过使用高斯混合模型(Mixture of Gaussians)将视频片段建模为概率分布,实现无需依赖数据增强的不确定性感知对比学习。通过从这些概率嵌入中采样并使用随机对比损失,ProViCo在UCF101和HMDB51上的动作识别与视频检索任务中均达到最先进性能。

ABSTRACT

This paper presents Probabilistic Video Contrastive Learning, a self-supervised representation learning method that bridges contrastive learning with probabilistic representation. We hypothesize that the clips composing the video have different distributions in short-term duration, but can represent the complicated and sophisticated video distribution through combination in a common embedding space. Thus, the proposed method represents video clips as normal distributions and combines them into a Mixture of Gaussians to model the whole video distribution. By sampling embeddings from the whole video distribution, we can circumvent the careful sampling strategy or transformations to generate augmented views of the clips, unlike previous deterministic methods that have mainly focused on such sample generation strategies for contrastive learning. We further propose a stochastic contrastive loss to learn proper video distributions and handle the inherent uncertainty from the nature of the raw video. Experimental results verify that our probabilistic embedding stands as a state-of-the-art video representation learning for action recognition and video retrieval on the most popular benchmarks, including UCF101 and HMDB51.

研究动机与目标

  • 解决确定性视频嵌入在捕捉复杂、噪声较大的视频分布及高不确定性时的局限性。
  • 消除对精心设计的数据增强策略的依赖,此类策略可能扭曲视频内容或损害性能。
  • 将完整视频分布建模为概率混合模型,通过不确定性感知采样实现鲁棒的对比学习。
  • 通过学习跨视频的语义相关样本对来提升表征质量,同时降低噪声或不确定样本的影响。
  • 提供一种系统化的方法来估计不确定性,并将其与模型性能相关联,从而支持失败分析与难度估计。

提出的方法

  • 在嵌入空间中将每个视频片段表示为正态分布,其均值与方差由神经网络学习得到。
  • 通过组合片段级别的分布,将整个视频建模为高斯混合模型(MoG),以捕捉时间动态的完整分布。
  • 基于从MoG分布中采样的样本之间的概率距离构建正负样本对,而非基于确定性点对。
  • 引入一种随机对比损失,通过抑制高方差(噪声)样本的影响来体现不确定性,灵感来源于软对比学习。
  • 在推理过程中使用蒙特卡洛采样,每个视频采样K=10个嵌入,以近似完整的MoG分布并提升鲁棒性。
  • 应用KL散度正则化,使用超参数β平衡分布紧凑性与可分性,发现β=10−4为最优选择。

实验结果

研究问题

  • RQ1与确定性点嵌入相比,将视频片段建模为概率分布是否能提升自监督视频表征学习性能?
  • RQ2不确定性感知的对比学习是否能减轻噪声或低质量增强视频样本对表征质量的负面影响?
  • RQ3概率嵌入是否能在不依赖数据增强的情况下,捕捉不同视频间片段的语义相关性?
  • RQ4视频表征的不确定性与下游性能之间存在何种关联?其是否可用于估计模型可靠性或失败概率?
  • RQ5所提出方法是否能在不使用时间或空间数据增强的情况下,在UCF101和HMDB51等标准基准上实现最先进性能?

主要发现

  • ProViCo在使用ResNet-50主干网络时,在UCF101上达到94.8%的最先进动作识别准确率,在HMDB51上达到72.1%,优于以往自监督方法。
  • 最优的KL散度正则化超参数β=10−4在分布紧凑性与可分性之间实现平衡,当β过小或过大时性能均下降。
  • 增加采样嵌入数K可提升性能,因能更优地近似MoG的蒙特卡洛积分,K=10被选为计算效率的折中方案。
  • 视频不确定性与检索性能之间存在负相关关系:不确定性越高,top-1准确率越低,验证了不确定性作为预测难度可靠代理的有效性。
  • 模型在训练过程中逐步降低不确定性,且该降低过程与UCF101检索性能的提升密切相关。
  • 可视化与消融实验表明,所提方法能有效建模复杂的视频分布,并降低对噪声或损坏样本的敏感性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。