Skip to main content
QUICK REVIEW

[论文解读] Self-Supervised Video Representation Learning With Odd-One-Out Networks

Basura Fernando, Hakan Bilen|arXiv (Cornell University)|Nov 21, 2016
Human Pose and Action Recognition参考文献 41被引用 7
一句话总结

该论文提出了一种名为 O3N(Odd-One-Out Networks)的自监督学习方法,用于视频表征学习。该方法通过训练一个多流卷积神经网络(CNN),从一组时序排列正确的视频片段中识别出一个时序错乱的片段。该方法仅使用视频数据,在 UCF101 上达到 60.3% 的准确率,在 HMDB51 上达到 32.5% 的准确率,相较于以往的自监督方法在两个基准测试上均提升了超过 10%。

ABSTRACT

We propose a new self-supervised CNN pre-training technique based on a novel auxiliary task called "odd-one-out learning". In this task, the machine is asked to identify the unrelated or odd element from a set of otherwise related elements. We apply this technique to self-supervised video representation learning where we sample subsequences from videos and ask the network to learn to predict the odd video subsequence. The odd video subsequence is sampled such that it has wrong temporal order of frames while the even ones have the correct temporal order. Therefore, to generate a odd-one-out question no manual annotation is required. Our learning machine is implemented as multi-stream convolutional neural network, which is learned end-to-end. Using odd-one-out networks, we learn temporal representations for videos that generalizes to other related tasks such as action recognition. On action classification, our method obtains 60.3\% on the UCF101 dataset using only UCF101 data for training which is approximately 10% better than current state-of-the-art self-supervised learning methods. Similarly, on HMDB51 dataset we outperform self-supervised state-of-the art methods by 12.7% on action classification task.

研究动机与目标

  • 开发一种不依赖人工标注动作标签的自监督视频表征学习方法。
  • 解决仅使用无标签数据学习视频时序一致性的挑战。
  • 在无需外部监督或 ImageNet 预训练的情况下,提升视频特征在下游动作识别任务中的泛化能力。
  • 通过一种新颖的辅助任务——在一组相关视频片段中识别出“异类”片段,探索视频中的类比推理能力。

提出的方法

  • 该方法采用多分支卷积神经网络架构,每个分支处理一组 N+1 个片段中的一个视频片段。
  • 将异类识别任务定义为:从 N 个时序排列正确的片段中,识别出时序顺序错误的那个片段。
  • 网络端到端训练,以预测异类片段,利用时序一致性作为监督信号。
  • 评估了三种视频片段编码方法:帧间差分之和、动态图像和帧差分的堆叠。
  • 训练过程中,异类片段在 N+1 个位置中随机排列,以防止出现平凡解。
  • 使用标准的 UCF101 和 HMDB51 划分,在动作分类任务上对特征进行微调。

实验结果

研究问题

  • RQ1基于异类识别推理的自监督学习方法,是否能在无人工标注标签的情况下学习到有效的视频表征?
  • RQ2与现有自监督方法相比,异类识别学习在动作识别任务上的泛化能力如何?
  • RQ3该方法是否受益于不同的视频片段编码策略,如帧差分之和或动态图像?
  • RQ4所学习的特征是否能在 UCF101 和 HMDB51 等标准基准上超越当前最先进方法?
  • RQ5异类识别任务在多大程度上促进了对视频中时空运动模式的学习?

主要发现

  • O3N 方法在仅使用 UCF101 数据进行训练的情况下,实现了 60.3% 的 top-1 准确率,相较于以往的自监督方法提升了 10 个百分点。
  • 在 HMDB51 上,该方法实现了 32.5% 的准确率,比之前最先进方法高出 12.7 个百分点。
  • 在三种评估的编码器中,帧差分堆叠(stack-of-differences)编码器表现最佳,在 UCF101 上达到 60.3% 的准确率,在 HMDB51 上达到 32.5% 的准确率。
  • 对学习到的滤波器进行可视化显示,不同编码器呈现出明显的模式差异,表明网络学习到了与任务相关的运动表征。
  • 该方法在不同视频片段编码技术上均表现出泛化能力,相较于随机初始化和基线自监督方法,始终实现一致的性能提升。
  • 即使不进行 ImageNet 预训练,O3N 仍能取得优异性能,表明其作为监督预训练的完全自监督替代方案具有巨大潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。