Skip to main content
QUICK REVIEW

[论文解读] Dense Optical Flow Prediction from a Static Image

Jacob Walker, Abhinav Gupta|arXiv (Cornell University)|May 2, 2015
Human Pose and Action Recognition参考文献 25被引用 18
一句话总结

本文提出一种卷积神经网络(CNN),通过在数以万计的未标注视频上进行自监督学习,从单张静态图像中预测密集光流。该模型通过从场景结构和动作姿态中推断运动上下文,实现了最先进性能,且无需人工标注或特定代理假设。

ABSTRACT

Given a scene, what is going to move, and in what direction will it move? Such a question could be considered a non-semantic form of action prediction. In this work, we present a convolutional neural network (CNN) based approach for motion prediction. Given a static image, this CNN predicts the future motion of each and every pixel in the image in terms of optical flow. Our CNN model leverages the data in tens of thousands of realistic videos to train our model. Our method relies on absolutely no human labeling and is able to predict motion based on the context of the scene. Because our CNN model makes no assumptions about the underlying scene, it can predict future optical flow on a diverse set of scenarios. We outperform all previous approaches by large margins.

研究动机与目标

  • 在不依赖人工标注的动作标签或以代理为中心假设的前提下,实现从单张静态图像进行泛化运动预测。
  • 开发一种深度学习框架,基于姿态和场景布局等上下文线索,推断像素级未来运动(光流)。
  • 在大规模、非结构化的视频数据上进行训练,以实现在室内和室外环境中多种代理的泛化能力。
  • 通过将单帧模型扩展为预测光流帧序列,探索长距离运动预测。
  • 证明在视频数据上进行自监督预训练即使没有ImageNet风格的监督预训练,也能取得优异性能。

提出的方法

  • 使用通过预训练光流算法从未标注视频片段中提取的光流标签,训练CNN从单张图像预测密集光流。
  • 在UCF-101和HMDB-51数据集上利用自监督学习,避免使用任何人工标注的动作或运动标签。
  • 采用多阶段全连接网络并使用非共享权重,以预测光流帧序列,将时间演化建模为一系列离散光流簇。
  • 应用k-means聚类生成包含1000个代表性光流帧的码书,将未来运动预测视为序列生成任务。
  • 采用受展开RNN启发的时序深层架构,其中每个预测步骤可访问所有先前隐藏状态和图像特征。
  • 通过去除相机运动来稳定训练数据,使网络专注于物体层面的运动,尽管在无稳定化处理的情况下性能仍保持稳健。

实验结果

研究问题

  • RQ1深度CNN能否在不使用任何人工标注的运动或动作标签的情况下,从单张静态图像预测密集光流?
  • RQ2与监督或领域特定方法相比,大规模视频数据上的自监督训练在多样化场景和运动类型上的泛化能力如何?
  • RQ3该模型能否泛化到其训练分布之外的未见环境和运动模式?
  • RQ4能否将单帧光流预测模型扩展为预测多帧运动序列?
  • RQ5在该运动预测任务中,自监督预训练的性能与监督ImageNet预训练相比如何?

主要发现

  • 所提出的CNN模型在从单张图像预测密集光流方面达到最先进性能,优于所有先前方法。
  • 在UCF-101上训练并在HMDB-51上测试,以及反向测试时,性能依然强劲,表明在多样化视频领域间具有强大泛化能力。
  • 与随机初始化相比,视频数据上的自监督预训练取得更优结果,但监督ImageNet预训练仅带来微小提升。
  • 该模型对相机运动具有鲁棒性:即使在非稳定化视频数据上训练,性能也仅轻微下降。
  • 多帧扩展成功预测了光流帧序列,证明了采用聚类离散序列生成方法进行长距离运动预测的可行性。
  • 尽管参数量更高,全连接时序网络的表现优于基于LSTM的架构,后者在实验中往往退化为均值轨迹。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。