Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Learning of Video Representations via Dense Trajectory Clustering

Pavel Tokmakov, Martial Hebert|arXiv (Cornell University)|Jun 28, 2020
Human Pose and Action Recognition参考文献 45被引用 16
一句话总结

本文提出了一种新颖的无监督视频表征学习方法,该方法在基于聚类的训练框架中利用改进密集轨迹(IDT)作为无监督先验。通过在IDT特征空间中对视频进行聚类,并联合微调3D卷积神经网络(3D ConvNet)以使用非参数分类损失,该方法学习到与运动相关的表征,在UCF101和HMDB51数据集上优于以往的自监督方法,使用64帧输入时在UCF101上达到83.0%的准确率,在HMDB51上达到90.7%。

ABSTRACT

This paper addresses the task of unsupervised learning of representations for action recognition in videos. Previous works proposed to utilize future prediction, or other domain-specific objectives to train a network, but achieved only limited success. In contrast, in the relevant field of image representation learning, simpler, discrimination-based methods have recently bridged the gap to fully-supervised performance. We first propose to adapt two top performing objectives in this class - instance recognition and local aggregation, to the video domain. In particular, the latter approach iterates between clustering the videos in the feature space of a network and updating it to respect the cluster with a non-parametric classification loss. We observe promising performance, but qualitative analysis shows that the learned representations fail to capture motion patterns, grouping the videos based on appearance. To mitigate this issue, we turn to the heuristic-based IDT descriptors, that were manually designed to encode motion patterns in videos. We form the clusters in the IDT space, using these descriptors as a an unsupervised prior in the iterative local aggregation algorithm. Our experiments demonstrates that this approach outperform prior work on UCF101 and HMDB51 action recognition benchmarks. We also qualitatively analyze the learned representations and show that they successfully capture video dynamics.

研究动机与目标

  • 解决现有自监督视频表征学习方法的局限性,即由于3D卷积神经网络中外观线索占主导地位,无法有效捕捉运动模式。
  • 将成功的图像级别自监督目标(实例识别与局部聚合)适配到视频领域。
  • 通过在基于聚类的训练过程中引入基于启发式的IDT描述符作为无监督先验,改进运动建模。
  • 在标准动作识别基准(UCF101和HMDB51)上评估所提方法在全微调和少样本设置下的有效性。
  • 定性和定量分析所学习的表征是否捕捉了超越外观的视频动态特性。

提出的方法

  • 通过将每段视频视为一个独立类别,将实例识别目标适配到视频任务中,并使用交叉熵损失训练3D卷积神经网络。
  • 通过迭代地使用K-means对视频特征进行聚类,并利用非参数分类损失更新网络,将局部聚合方法扩展到视频任务。
  • 使用改进密集轨迹(IDT)作为对运动敏感的特征空间,以定义初始视频聚类,为时间结构提供无监督先验。
  • 首先在固定的IDT聚类上训练3D卷积神经网络,然后通过迭代局部聚合框架,在IDT空间和深度特征空间中联合微调。
  • 在Kinetics数据集上无标签预训练模型,随后在UCF101和HMDB51上进行微调以评估动作识别性能。
  • 使用IDT描述符的Fisher向量编码作为强基线进行比较。

实验结果

研究问题

  • RQ1图像表征学习中的基于分类的自监督目标能否有效适配到视频表征学习中?
  • RQ2为何标准的基于聚类的视频学习目标无法捕捉运动模式,与图像级别方法相比性能差距的根源是什么?
  • RQ3基于启发式的视频描述符(如IDT)能否作为有效的无监督先验,以指导3D卷积神经网络训练并改善运动建模?
  • RQ4将基于IDT的聚类与端到端3D卷积神经网络学习相结合,是否能带来优于先前自监督方法的动作识别性能?
  • RQ5所学习的聚类在多大程度上反映了视频动态,而非仅外观或场景线索?

主要发现

  • 当使用64帧输入序列时,所提方法在UCF101上达到83.0%的准确率,在HMDB51上达到90.7%,优于所有采用相同3D ResNet18架构的先前自监督方法。
  • 在HMDB51上,尽管CBT方法使用更深的网络,该方法仍比其高出15.0个百分点(以全监督性能的占比衡量),显示出显著优势。
  • 16帧版本的该方法在UCF101上比CBT高出4.4个百分点,在HMDB51上高出15.0个百分点(以归一化性能衡量),表明其具有强大的泛化能力。
  • 即使DPC使用更深的3D ResNet34和更长的120帧序列,该方法仍表现更优,证明了IDT先验在运动建模中的有效性。
  • 定性分析确认,所学习的聚类是基于运动动态而非仅外观,聚类通常将不同场景中的相同动作分组。
  • 64帧模型在UCF101上的性能仅比完整长度IDT描述符(85.9%)低2.9%,表明结合IDT先验的端到端训练可逼近人工设计描述符的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。