Skip to main content
QUICK REVIEW

[论文解读] Locally Weighted Regression Pseudo-Rehearsal for Online Learning of Vehicle Dynamics

Grady Williams, Brian Goldfain|arXiv (Cornell University)|May 13, 2019
Domain Adaptation and Few-Shot Learning参考文献 25被引用 9
一句话总结

本文提出了一种新型在线学习方法——局部加权投影回归伪回放(LW-PR²),该方法结合了增量式LWPR与神经网络适应,以在车辆动力学建模中防止灾难性遗忘。通过利用在线更新的LWPR模型生成伪样本,该方法实现了在非平稳输入与目标分布下神经网络控制器的稳定、实时适应,在仿真和真实世界自动驾驶测试中均表现出鲁棒性能,且误差增长极小。

ABSTRACT

We consider the problem of online adaptation of a neural network designed to represent vehicle dynamics. The neural network model is intended to be used by an MPC control law to autonomously control the vehicle. This problem is challenging because both the input and target distributions are non-stationary, and naive approaches to online adaptation result in catastrophic forgetting, which can in turn lead to controller failures. We present a novel online learning method, which combines the pseudo-rehearsal method with locally weighted projection regression. We demonstrate the effectiveness of the resulting Locally Weighted Projection Regression Pseudo-Rehearsal (LW-PR$^2$) method in simulation and on a large real world dataset collected with a 1/5 scale autonomous vehicle.

研究动机与目标

  • 解决在非平稳输入与目标分布下,对车辆动力学建模进行在线神经网络适应时的灾难性遗忘问题。
  • 开发一种方法,实现在自动驾驶车辆MPC中使用的神经网络模型的实时、稳定适应。
  • 克服标准SGD和简单回放方法在状态与动力学随时间变化的动态环境中所面临的局限性。
  • 在环境与机械条件持续变化的长期、真实自动驾驶场景中验证该方法。

提出的方法

  • 该方法维护一个用于MPC的神经网络模型,以及一个增量更新的LWPR模型,用于生成正则化的伪样本。
  • 通过将随机或代表性输入输入当前LWPR模型,生成反映当前动力学的合成目标输出,从而创建伪样本。
  • 神经网络通过一种约束梯度更新进行训练,平衡新数据与伪样本之间的关系,防止其偏离系统辨识数据集。
  • LWPR模型在实时中增量更新,确保其能适应目标分布的变化,如道路摩擦变化或电池状态变化。
  • 采用约束优化方案,限制参数更新,防止因过度拟合新数据而损害先前学习到的动力学。
  • 该方法实现了安全、持续的在线学习,无需存储历史数据,适用于实时MPC应用。

实验结果

研究问题

  • RQ1当输入与目标分布均非平稳时,伪回放能否有效应用于车辆动力学的在线学习?
  • RQ2在长期自动驾驶运行过程中,如何减轻神经网络驱动的车辆动力学模型中的灾难性遗忘?
  • RQ3增量更新的LWPR模型能否生成高质量的伪样本,以稳定在线神经网络适应?
  • RQ4所提出的方法是否能在轮胎磨损、道路条件变化和电池状态变化等动态变化下,实现可靠的MPC控制?
  • RQ5在真实世界自动驾驶场景中,LW-PR²的性能与标准SGD及基线回放方法相比如何?

主要发现

  • 在长期自动驾驶实地测试中,LW-PR²在全天数据集上的总均方误差(MSE)为2.11,显著优于基线模型(MSE:3.18),并达到离线LWPR基线的性能水平。
  • 在真实世界自动驾驶过程中的实时主动性能表现为MSE为2.54,表明在最高50公里/小时的速度下,控制依然稳定。
  • 即使在长达4.5小时的运行中,车辆在湿滑与干燥赛道、电池状态变化等不同条件下运行,该方法仍成功防止了灾难性遗忘。
  • LW-PR²在MPC场景中优于标准SGD,尽管SGD在孤立验证集上表现相当,但在MPC中因不稳定性导致性能下降。
  • 约束梯度更新确保了模型即使在状态空间高误差区域暴露,也不会从原始系统辨识数据中漂移。
  • 利用增量式LWPR进行伪采样,有效适应了轮胎磨损和摩擦变化等动态变化,维持了长时间运行下的控制器可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。