Skip to main content
QUICK REVIEW

[论文解读] Symbolic Regression for Constructing Analytic Models in Reinforcement Learning

Erik Derner, Jiřı́ Kubalı́k|arXiv (Cornell University)|Mar 27, 2019
Reinforcement Learning in Robotics参考文献 37被引用 4
一句话总结

本文提出使用符号回归(SR)从有限数据中自动构建紧凑、可解释的解析模型,用于实时强化学习(RL)控制。通过将SR应用于状态空间和NARX型输入-输出模型,该方法在性能上优于深度神经网络和局部线性回归,在仅使用100个数据样本的情况下成功实现了真实摆的摆起控制。

ABSTRACT

Reinforcement learning (RL) is a widely used approach for controlling systems with unknown or time-varying dynamics. Even though RL does not require a model of the system, it is known to be faster and safer when using models learned online. We propose to employ symbolic regression (SR) to construct parsimonious process models described by analytic equations for real-time RL control. We have tested our method with two different state-of-the-art SR algorithms which automatically search for equations that fit the measured data. In addition to the standard problem formulation in the state-space domain, we show how the method can also be applied to input-output models of the NARX (nonlinear autoregressive with exogenous input) type. We present the approach on three simulated examples with up to 14-dimensional state space: an inverted pendulum, a mobile robot, and a biped walking robot. A comparison with deep neural networks and local linear regression shows that SR in most cases outperforms these commonly used alternative methods. We demonstrate on a real pendulum system that the analytic model found enables RL to successfully perform the swing-up task, based on a model constructed from only 100 data samples.

研究动机与目标

  • 通过从有限数据中构建可解释的解析过程模型,提升强化学习中的样本效率和安全性。
  • 解决在未知或时变行为系统中对复杂非线性动力学建模的挑战。
  • 通过生成计算高效且可解释的紧凑闭式方程,实现实时RL控制。
  • 在准确性、样本效率和鲁棒性方面,将符号回归与深度神经网络和局部线性回归进行比较。
  • 在模拟和真实世界机器人系统(包括高维状态空间)上验证该方法。

提出的方法

  • 采用两种最先进的符号回归算法,搜索最符合测量系统数据的解析方程。
  • 在状态空间和NARX(带外生输入的非线性自回归)框架下构建系统建模问题,以捕捉动态行为。
  • 通过数据驱动发现方程来表示系统动力学,确保模型简洁性和可解释性。
  • 使用符号模型训练强化学习智能体,执行摆起和稳定等控制任务。
  • 通过比较不同模型类型的预测精度和RL控制成功率来评估模型性能。
  • 将该方法应用于最高达14维状态空间的系统,包括倒立摆、移动机器人和双足行走机器人。

实验结果

研究问题

  • RQ1符号回归能否从有限数据中生成准确且紧凑的解析模型,以用于实时强化学习?
  • RQ2符号回归在建模非线性系统动力学方面,与深度神经网络和局部线性回归相比表现如何?
  • RQ3仅使用100个数据样本生成的符号模型能否在真实世界机器人系统中实现成功的RL控制?
  • RQ4与标准状态空间建模相比,NARX形式化是否能提高模型精度和控制性能?
  • RQ5可解释的解析模型在多大程度上提升了RL控制中的样本效率和安全性?

主要发现

  • 在所有模拟示例中,符号回归在建模精度方面始终优于深度神经网络和局部线性回归。
  • 该方法仅使用100个数据样本构建解析模型,成功实现了真实摆的摆起控制。
  • 所得模型既简洁又可解释,相较于黑箱深度学习模型具有显著优势。
  • 该方法在高维系统中表现有效,包括一个14维的双足行走机器人,展示了良好的可扩展性。
  • NARX形式化为输入-输出建模提供了一种可行的替代方案,在某些动态环境下改善了模型拟合效果。
  • 使用符号模型相比通过端到端神经网络学习的模型,实现了更快且更稳定的RL训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。