[论文解读] Lyapunov-Based Reinforcement Learning State Estimator
本文提出了一种基于李雅普诺夫的深度强化学习状态估计算法(LRLF),用于非线性离散时间随机系统,利用深度神经网络从仿真数据中学习滤波增益。该方法在无需初始误差或噪声假设的前提下,理论上保证了有界估计误差,在噪声协方差漂移和测量缺失等不确定性条件下,性能优于传统滤波器。
In this paper, we consider the state estimation problem for nonlinear stochastic discrete-time systems. We combine Lyapunov's method in control theory and deep reinforcement learning to design the state estimator. We theoretically prove the convergence of the bounded estimate error solely using the data simulated from the model. An actor-critic reinforcement learning algorithm is proposed to learn the state estimator approximated by a deep neural network. The convergence of the algorithm is analysed. The proposed Lyapunov-based reinforcement learning state estimator is compared with a number of existing nonlinear filtering methods through Monte Carlo simulations, showing its advantage in terms of estimate convergence even under some system uncertainties such as covariance shift in system noise and randomly missing measurements. To the best of our knowledge, this is the first reinforcement learning based nonlinear state estimator with bounded estimate error performance guarantee.
研究动机与目标
- 设计一种非线性状态估计算法,为离散时间随机系统提供可证明的有界估计误差。
- 消除对严格假设(如小初始误差或可忽略的线性化误差)的依赖,这些假设常见于EKF和UKF。
- 开发一种深度强化学习框架,从仿真数据中学习滤波增益,无需实时在线计算。
- 在无模型强化学习设置下,利用基于李雅普诺夫的分析方法,确保估计误差的理论稳定性和收敛性。
- 在系统不确定性(如噪声协方差漂移和测量缺失)下,提供状态估计的性能保证。
提出的方法
- 滤波增益通过一个使用系统模型仿真数据训练的深度神经网络(DNN)近似,训练采用演员-评论家强化学习算法。
- 应用李雅普诺夫直接法证明估计误差动态的稳定性,确保有界估计误差,且无需对初始误差或噪声水平做假设。
- 将训练目标建模为马尔可夫决策过程,其中状态为估计误差,动作为滤波增益更新。
- 算法使用评论家网络估计价值函数,演员网络输出滤波增益,两者均被训练以最小化期望估计误差。
- 在李雅普诺夫稳定性框架下,建立了强化学习算法的理论收敛性,确保估计过程中误差有界。
- 该方法通过蒙特卡洛仿真离线训练,实现高效在线部署,计算成本低。
实验结果
研究问题
- RQ1基于深度强化学习的状态估计算法是否能在不依赖初始误差或噪声强度假设的前提下,实现有界估计误差?
- RQ2李雅普诺夫稳定性理论能否有效整合到无模型强化学习框架中,以保证估计误差的收敛性?
- RQ3在系统不确定性(如噪声协方差漂移和随机缺失测量)下,所提估计算法的性能如何?
- RQ4当系统模型为非线性且非高斯时,该估计算法能否保持稳定性和准确性?
- RQ5在相同仿真条件下,该方法与经典滤波器(如EKF、UKF和PF)之间的性能差距如何?
主要发现
- 所提出的基于李雅普诺夫的强化学习状态估计算法(LRLF)在无需对初始误差或噪声强度做假设的前提下,实现了具有理论保证的有界估计误差。
- 在摆杆跟踪案例中,LRLF在存在噪声协方差漂移和测量缺失等模型不确定性时,表现出估计误差的稳定收敛,优于EKF、UKF和PF。
- 在车辆跟踪案例中,LRLF对位置和速度的估计精度接近最优卡尔曼滤波器,由于系统具有非线性和非高斯特性,误差略高属合理预期。
- 在机载目标跟踪场景中,LRLF即使在仅有方位角测量和非线性观测模型的情况下,仍能以低误差和强鲁棒性区间成功跟踪机动地面车辆的状态。
- 500次蒙特卡洛仿真实验结果表明,所有测试案例中性能一致,LRLF在不确定性条件下表现出优于现有滤波器的收敛性和鲁棒性。
- 据作者所知,该方法是首个为基于强化学习的非线性状态估计算法提供理论性能保证(有界误差)的工作。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。