Skip to main content
QUICK REVIEW

[论文解读] Physics-as-Inverse-Graphics: Unsupervised Physical Parameter Estimation from Video

Miguel Jaques, Michael Burke|arXiv (Cornell University)|May 27, 2019
Model Reduction and Neural Networks参考文献 48被引用 12
一句话总结

本文提出一种物理即逆图形(physics-as-inverse-graphics)框架,通过联合学习解耦的物体状态(位置/速度)与系统动力学,利用可微分物理引擎实现从视频中无监督地估计物理参数。该方法通过将已知运动方程作为归纳偏置,实现了最先进水平的长期视频预测与数据高效的视觉模型预测控制。

ABSTRACT

We propose a model that is able to perform unsupervised physical parameter estimation of systems from video, where the differential equations governing the scene dynamics are known, but labeled states or objects are not available. Existing physical scene understanding methods require either object state supervision, or do not integrate with differentiable physics to learn interpretable system parameters and states. We address this problem through a physics-as-inverse-graphics approach that brings together vision-as-inverse-graphics and differentiable physics engines, enabling objects and explicit state and velocity representations to be discovered. This framework allows us to perform long term extrapolative video prediction, as well as vision-based model-predictive control. Our approach significantly outperforms related unsupervised methods in long-term future frame prediction of systems with interacting objects (such as ball-spring or 3-body gravitational systems), due to its ability to build dynamics into the model as an inductive bias. We further show the value of this tight vision-physics integration by demonstrating data-efficient learning of vision-actuated model-based control for a pendulum system. We also show that the controller's interpretability provides unique capabilities in goal-driven control and physical reasoning for zero-data adaptation.

研究动机与目标

  • 解决在缺乏真实物体状态或外观监督的情况下,从视频中无监督估计物理参数的挑战。
  • 弥合无监督视觉物体发现与可微分物理引擎在长期动力学建模之间的差距。
  • 通过解耦的物理状态表征,实现数据高效、可解释的视觉模型预测控制。
  • 通过基于学习参数的反事实物理推理,实现控制任务中的零样本适应。
  • 证明将已知物理规律作为归纳偏置可提升视频预测与控制任务中的泛化能力。

提出的方法

  • 采用视觉即逆图形的编码器-解码器架构,结合空间变换器(ST),将视频帧分解为解耦的、可解释的物体状态(位置与速度)。
  • 使用可微分物理引擎,基于已知微分方程(如弹簧-质量系统或引力系统)模拟系统动力学,并学习可微参数。
  • 通过可微渲染,在潜在状态表征与图像重建过程之间强制坐标一致性。
  • 端到端训练,使用重建损失与物理一致性损失,实现视觉特征、物体状态与物理参数的联合优化。
  • 将学习到的状态与参数表征集成到模型预测控制(MPC)框架中,实现视觉控制。
  • 利用解耦表征实现无需微调的目标参数化控制与反事实推理。

实验结果

研究问题

  • RQ1模型能否在无任何物体状态或外观监督的情况下,从未知视频中学习物理参数(如弹簧常数、重力加速度)?
  • RQ2该模型在具有相互作用物体的复杂物理系统中,长期视频预测性能如何?
  • RQ3解耦的物理状态表征是否能实现视觉控制任务中数据高效、可解释的模型预测控制?
  • RQ4通过零样本物理推理,模型在未见环境条件(如改变重力)下的泛化能力如何?
  • RQ5与纯端到端学习方法相比,将已知物理规律作为归纳偏置是否能提升无监督视频建模与控制的性能?

主要发现

  • 模型能从视频中准确恢复物理参数,重力估计值为 g = 9.95,作用系数 a = 0.99,与真实值一致。
  • 在小球-弹簧系统与三体引力系统中,该模型在长期视频预测任务上优于现有无监督方法,展现出更强的外推泛化能力。
  • 该方法实现了对欠驱动摆的视觉控制的数据高效学习,性能与 PlaNet 相当,但显著快于从像素输入训练的 DDPG。
  • 控制器在未重新训练的情况下,实现对新重力值(如基线的 1.4 倍)的零样本适应,归因于通过学习参数实现的可解释物理推理。
  • 该模型支持目标参数化控制,仅需一次垂直目标训练样本,即可直接实现对任意目标角度的到达,并在目标空间中实现泛化。
  • 解耦且可解释的状态表征赋予模型独特能力,如反事实推理与物理推断,这些能力是基于奖励或隐式物理模型的模型所不具备的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。