Skip to main content
QUICK REVIEW

[论文解读] Object-Centric Representation Learning from Unlabeled Videos

Ruohan Gao, Dinesh Jayaraman|arXiv (Cornell University)|Dec 1, 2016
Domain Adaptation and Few-Shot Learning参考文献 28被引用 8
一句话总结

本文提出了一种用于未标注视频的以对象为中心的无监督表征学习框架,通过区域提议学习不变特征,无需跟踪。通过在时空相邻的对象类区域上训练孪生三元组网络,该方法在图像分类和检索任务中实现了最先进性能,在MIT Indoor 67、PASCAL VOC 2007和VOC 2012数据集上均优于以往的无监督方法。

ABSTRACT

Supervised (pre-)training currently yields state-of-the-art performance for representation learning for visual recognition, yet it comes at the cost of (1) intensive manual annotations and (2) an inherent restriction in the scope of data relevant for learning. In this work, we explore unsupervised feature learning from unlabeled video. We introduce a novel object-centric approach to temporal coherence that encourages similar representations to be learned for object-like regions segmented from nearby frames. Our framework relies on a Siamese-triplet network to train a deep convolutional neural network (CNN) representation. Compared to existing temporal coherence methods, our idea has the advantage of lightweight preprocessing of the unlabeled video (no tracking required) while still being able to extract object-level regions from which to learn invariances. Furthermore, as we show in results on several standard datasets, our method typically achieves substantial accuracy gains over competing unsupervised methods for image classification and retrieval tasks.

研究动机与目标

  • 解决监督预训练的局限性,后者依赖于昂贵的手动标注,并将学习限制在静态、标注的图像分布上。
  • 克服现有无监督视频方法的缺点,这些方法要么嵌入整个图像帧(损失局部不变性),要么需要复杂的跟踪(偏向运动,计算开销大)。
  • 通过聚焦于以对象为中心的区域而非完整帧或追踪的补丁,实现从未标注视频中学习稳健的、对象级别的不变性。
  • 证明基于区域提议的表征学习可以生成强大的、可泛化的特征,用于下游识别任务,且无需监督。

提出的方法

  • 使用选择性搜索在单个视频帧上生成类似对象的区域提议,以识别候选对象区域。
  • 在连续帧之间识别时空相邻的区域提议对作为正样本训练对。
  • 训练一个孪生三元组网络,使空间和时间上相邻的正样本对在特征空间中更接近,而负样本对则更远。
  • 使用对比损失目标,强制将来自同一对象或对象部分的区域提议(即使外观或姿态有变化)映射到相似的嵌入。
  • 利用视频的时间连贯性——相邻帧显示渐变变化——在不显式跟踪的情况下学习对象级别的不变性。
  • 使用区域提议作为输入,通过三元组损失训练深层卷积神经网络,使模型能够学习通用的、以对象为中心的表征。

实验结果

研究问题

  • RQ1基于未标注视频的以对象为中心的表征学习是否能优于基于整体帧或基于追踪的无监督方法?
  • RQ2与完整帧或追踪补丁相比,基于区域提议的学习是否能带来更好的不变性和泛化能力?
  • RQ3一种轻量级、无需跟踪的方法能否在性能上与最先进无监督预训练基线相媲美?
  • RQ4在下游分类和检索任务中,使用少量标注数据进行微调时,该方法的有效性如何?
  • RQ5使用区域提议是否有助于捕捉静态或部分运动对象中超越运动的不变性,例如光照和视角变化?

主要发现

  • 在MIT Indoor 67上,该方法达到38.1%的准确率,超过所有基线无监督方法,并在相似数据设置下比视觉追踪基线[7]高出1.5个百分点。
  • 在PASCAL VOC 2007上,该方法达到45.6%的mAP,比次佳无监督方法(Pathak等人[12])高出2.9个百分点,比视觉追踪基线高出2.0个百分点。
  • 在PASCAL VOC 2012上,该方法达到44.1%的mAP,比视觉追踪基线[7]高出2.0个百分点,比次佳基线高出1.8个百分点。
  • 在自监督预训练设置下,该方法在MIT Indoor 67上达到34%准确率,在VOC 2007上达到46% mAP,显著优于随机高斯初始化(28.9%和41.3%)及其他无监督基线。
  • 消融研究证实,基于区域提议的训练比完整帧或方形区域基线更有效,表明局部化、以对象为中心学习的优势。
  • 该方法在下游任务中泛化良好:即使在小规模标注数据集上微调后,仍持续优于所有其他无监督预训练基线。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。