Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Learning of Lagrangian Dynamics from Images for Prediction and Control

Yaofeng Desmond Zhong, Naomi Ehrich Leonard|arXiv (Cornell University)|Jul 3, 2020
Computational Physics and Python Applications被引用 10
一句话总结

该论文提出了一种无监督深度学习框架,能够从平面刚体系统的图像观测中联合学习可解释的广义坐标与拉格朗日动力学。通过结合一种坐标感知的变分自编码器(VAE)与拉格朗日动力学模型,该方法实现了高精度的长期图像空间预测,并能合成基于能量的控制器,在预测与控制任务中均优于基线模型,同时保持了物理可解释性。

ABSTRACT

Recent approaches for modelling dynamics of physical systems with neural networks enforce Lagrangian or Hamiltonian structure to improve prediction and generalization. However, when coordinates are embedded in high-dimensional data such as images, these approaches either lose interpretability or can only be applied to one particular example. We introduce a new unsupervised neural network model that learns Lagrangian dynamics from images, with interpretability that benefits prediction and control. The model infers Lagrangian dynamics on generalized coordinates that are simultaneously learned with a coordinate-aware variational autoencoder (VAE). The VAE is designed to account for the geometry of physical systems composed of multiple rigid bodies in the plane. By inferring interpretable Lagrangian dynamics, the model learns physical system properties, such as kinetic and potential energy, which enables long-term prediction of dynamics in the image space and synthesis of energy-based controllers.

研究动机与目标

  • 实现从图像数据中无坐标标注的、数据高效的无监督物理动力学学习。
  • 直接从图像序列中使用坐标感知VAE推断可解释的广义坐标(尤其是旋转与平动坐标)。
  • 在潜在空间中强制实施拉格朗日动力学,以提升长期预测精度与物理一致性。
  • 利用学习到的可解释动力学合成基于能量的控制器,用于控制任务。
  • 克服先前方法的局限性,如需要坐标监督、使用高维非可解释潜在表示,或无法泛化至多体系统。

提出的方法

  • 设计了一种坐标感知变分自编码器(VAE),用于从图像输入中推断可解释的广义坐标(如角度与位置),显式建模平面刚体的几何结构。
  • VAE通过图像重建与物理启发正则化项进行无监督训练,以确保潜在空间反映物理构型。
  • 在推断的潜在空间中训练拉格朗日动力学模型,通过可微分的ODE积分器强制能量守恒与辛结构。
  • VAE与动力学模型的联合训练实现了从原始图像序列端到端学习坐标与动力学。
  • 通过拉格朗日公式引入物理先验,编码动能与势能项,提升泛化性与稳定性。
  • 将控制输入集成至动力学模型,支持基于能量的控制器合成,以利用学习到的物理结构。

实验结果

研究问题

  • RQ1能否从平面刚体系统图像序列中无监督地推断出可解释的广义坐标?
  • RQ2能否在无坐标监督的情况下,从图像导出的潜在空间中有效学习拉格朗日动力学?
  • RQ3与非物理基线相比,强制实施拉格朗日先验是否能提升长期预测精度与泛化能力?
  • RQ4所学动力学是否能支持有效且物理可解释的视觉控制控制器的合成?
  • RQ5VAE中的坐标感知组件在整体模型的可解释性与性能方面起到了何种作用?

主要发现

  • 所提模型在图像空间预测性能上达到当前最优,Pendulum任务的像素均方误差为1.52×10³,优于HGN(2.67×10³)与MLPdyn+caVAE(14.18×10³)。
  • 模型实现了长期预测中能量守恒的稳定性,表现为在长时间轨迹上动能与势能曲线的一致性。
  • 坐标感知解码器对学习可解释坐标贡献最大,而坐标感知编码器则提供次要但有意义的改进。
  • 消融实验表明,若将坐标感知VAE替换为标准AE或PAIG模型,则在CartPole任务中失败,表明几何归纳偏置的必要性。
  • 模型成功泛化至未见的控制输入,并能合成稳定系统的基于能量的控制器,证明了控制可行性。
  • 尽管HGN具有高维潜在空间,但在CartPole任务的测试数据集上仍无法泛化,凸显了本方法在数据效率与泛化能力方面的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。