Skip to main content
QUICK REVIEW

[论文解读] Bayesian autoencoders for data-driven discovery of coordinates, governing equations and fundamental constants

Liyao Gao, J. Nathan Kutz|arXiv (Cornell University)|Nov 19, 2022
Gaussian Processes and Bayesian Inference被引用 4
一句话总结

该论文提出了一种贝叶斯SINDy自编码器,通过分层Spike-and-slab高斯-拉普拉斯先验实现稀疏识别,联合从低数据量、高噪声的时空数据中发现潜在坐标和控制方程。该方法利用随机梯度朗之万动力学(SGLD)实现计算上可行的贝叶斯后验采样,实现了具有不确定性量化能力的精确物理发现——在仅14秒真实视频数据下成功恢复了单摆方程并估算了重力常数$g$。

ABSTRACT

Recent progress in autoencoder-based sparse identification of nonlinear dynamics (SINDy) under $\ell_1$ constraints allows joint discoveries of governing equations and latent coordinate systems from spatio-temporal data, including simulated video frames. However, it is challenging for $\ell_1$-based sparse inference to perform correct identification for real data due to the noisy measurements and often limited sample sizes. To address the data-driven discovery of physics in the low-data and high-noise regimes, we propose Bayesian SINDy autoencoders, which incorporate a hierarchical Bayesian sparsifying prior: Spike-and-slab Gaussian Lasso. Bayesian SINDy autoencoder enables the joint discovery of governing equations and coordinate systems with a theoretically guaranteed uncertainty estimate. To resolve the challenging computational tractability of the Bayesian hierarchical setting, we adapt an adaptive empirical Bayesian method with Stochatic gradient Langevin dynamics (SGLD) which gives a computationally tractable way of Bayesian posterior sampling within our framework. Bayesian SINDy autoencoder achieves better physics discovery with lower data and fewer training epochs, along with valid uncertainty quantification suggested by the experimental studies. The Bayesian SINDy autoencoder can be applied to real video data, with accurate physics discovery which correctly identifies the governing equation and provides a close estimate for standard physics constants like gravity $g$, for example, in videos of a pendulum.

研究动机与目标

  • 解决传统稀疏回归在低数据、高噪声环境下因不稳定性和泛化能力差而失效的问题。
  • 将贝叶斯稀疏推断与自编码器结合,实现动力系统中潜在坐标与控制方程的联合发现。
  • 为发现的模型提供理论基础坚实的不确定性量化,这对可靠的数据驱动决策至关重要。
  • 通过自适应经验贝叶斯与SGLD采样,克服大规模或高维设置下层次贝叶斯模型的计算不可行性。
  • 实现从真实世界视频数据(如单摆运动)中稳健发现,其中时间导数噪声大且样本量有限。

提出的方法

  • 该框架将深度自编码器与贝叶斯SINDy模块相结合,其中SINDy层应用Spike-and-slab高斯-拉普拉斯(SSGL)先验,以在控制方程系数中强制实现稀疏性。
  • SSGL先验通过将每个系数建模为零点质量(spike)与拉普拉斯分布(slab)的混合,实现变量选择与不确定性估计的联合建模。
  • 采用自适应经验贝叶斯方法近似模型参数的后验分布,避免了对完整MCMC采样的依赖。
  • 采用随机梯度朗之万动力学(SGLD)高效执行贝叶斯后验采样,实现对真实视频数据的可扩展训练。
  • 该方法联合优化自编码器重构损失、SINDy预测损失与贝叶斯证据,不确定性通过后验样本传播。
  • 架构通过基于可微SGLD的后验近似端到端训练,支持基于梯度的优化,同时保持不确定性估计。

实验结果

研究问题

  • RQ1在低数据量和高噪声条件下,贝叶斯SINDy自编码器是否能优于标准SINDy自编码器,实现对控制方程与潜在坐标的发现?
  • RQ2当真实动力学被错误指定或数据存在噪声时,该贝叶斯框架在发现模型的不确定性量化方面表现如何?
  • RQ3与基于L1的稀疏性相比,分层Spike-and-slab先验是否在真实视频数据中提升了模型选择的准确率与鲁棒性?
  • RQ4该方法能否仅从极少量真实世界视频片段中成功恢复基本物理常数(如重力$g$)?
  • RQ5该贝叶斯框架的不确定性量化在多大程度上提升了发现模型的可靠性与可解释性?

主要发现

  • 贝叶斯SINDy自编码器仅使用14秒真实视频数据,成功发现了单摆的控制方程$\ddot{z} = -g\sin(z)$,重构的$g$值接近真实物理常数。
  • 该方法的解码器损失为0.779,$\ddot{x}$的重构损失为0.364,$\ddot{z}$的重构损失为0.416,重构中未解释方差的比例为0.012。
  • SINDy预测中未解释方差的比例为0.210($\ddot{x}$)与0.941($\ddot{z}$),表明尽管存在噪声,其在潜在动力学上仍表现出色。
  • 即使拉普拉斯先验未能识别出正确项$\sin(z)$,贝叶斯框架仍提供了有效的不确定性估计,如后验样本所可视化所示。
  • Spike-and-slab先验在模型发现准确率与视觉重构质量上均优于拉普拉斯先验,后者错误识别了$z$而非$\sin(z)$作为正确项。
  • 该方法仅需1,500个训练周期,10次实验中70%的成功率完成发现,其余30%因模型误设而未能识别出活跃项。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。