Skip to main content
QUICK REVIEW

[论文解读] Structured Object-Aware Physics Prediction for Video Modeling and Planning

Jannik Kossen, Karl Stelzner|arXiv (Cornell University)|Oct 6, 2019
Human Pose and Action Recognition参考文献 48被引用 18
一句话总结

本文提出STOVE,一种结构化、对象感知的状态空间模型,能够以无监督方式从视频数据中联合学习以对象为中心的表征和物理动力学。通过结合图像推理网络与动力学模型,并在变分推理中重用动力学模型,STOVE 实现了具有真实物理特性的长时程视频预测,其性能超越了先前的无监督模型,且在质量上接近有监督基线,同时实现了样本高效的基于模型的强化学习。

ABSTRACT

When humans observe a physical system, they can easily locate objects, understand their interactions, and anticipate future behavior, even in settings with complicated and previously unseen interactions. For computers, however, learning such models from videos in an unsupervised fashion is an unsolved research problem. In this paper, we present STOVE, a novel state-space model for videos, which explicitly reasons about objects and their positions, velocities, and interactions. It is constructed by combining an image model and a dynamics model in compositional manner and improves on previous work by reusing the dynamics model for inference, accelerating and regularizing training. STOVE predicts videos with convincing physical behavior over hundreds of timesteps, outperforms previous unsupervised models, and even approaches the performance of supervised baselines. We further demonstrate the strength of our model as a simulator for sample efficient model-based control in a task with heavily interacting objects.

研究动机与目标

  • 开发一种统一的无监督视频建模框架,能够显式地推理对象、其位置、速度及其相互作用。
  • 通过在组合式状态空间模型中整合结构化图像建模与物理感知动力学,提升长期视频预测性能。
  • 通过将学习到的模型用作规划的模拟器,实现样本高效的基于模型的强化学习。
  • 解决先前无监督模型在处理高视觉保真度的复杂交互物理系统时的局限性。

提出的方法

  • STOVE 使用变分推理框架,其中对象状态的后验分布通过结合当前帧的视觉提议和先验状态的动力学提议形成。
  • 动力学模型在推理网络中被重用,共享均值参数但不共享方差,从而在训练中起到正则化作用并加速收敛。
  • 对象状态以空间位置、速度和外观特征表示,对象掩码通过可微注意力机制推断。
  • 生成模型使用求和-乘积网络,以高效计算给定对象状态下的观测帧似然。
  • 模型通过随机梯度下降端到端训练,使用变分下界(ELBO)目标函数。
  • 在基于模型的控制中,动力学模型被扩展为可对动作进行条件化并预测奖励,从而支持使用蒙特卡洛树搜索(MCTS)进行规划。

实验结果

研究问题

  • RQ1统一的、对象感知的状态空间模型是否能在纯无监督设置下,学习预测具有真实物理交互的长时程视频序列?
  • RQ2在推理网络中重用生成动力学模型对训练稳定性、速度和预测性能有何影响?
  • RQ3具有显式对象推理能力的无监督视频模型,在多大程度上能匹配拥有真实对象状态信息的有监督基线模型的性能?
  • RQ4此类模型是否可作为有效模拟器,用于在视觉复杂的环境中实现样本高效的基于模型的强化学习?

主要发现

  • STOVE 能够生成数百个时间步的高保真视频滚动,展现出长期的物理一致性与合理的对象交互。
  • 在定量指标(如 FVD、LPIPS)和定性视觉质量方面,STOVE 均优于先前的无监督视频模型。
  • STOVE 的性能接近使用真实对象状态的有监督基线,表明其仅从原始视频中即可实现强大泛化能力。
  • 在基于模型的强化学习中,STOVE 使基于 MCTS 的智能体在使用超过10倍少的环境交互样本下,仍能达到与无模型 PPO 基线相当的性能。
  • 在推理中重用动力学模型相比标准变分推理设置,能实现更快的收敛速度和更高的训练稳定性。
  • 该模型成功处理了多个对象之间的复杂非线性交互,包括弹跳与碰撞动力学,且无需对对象身份或轨迹进行显式监督。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。