[论文解读] Model-based Reinforcement Learning from Signal Temporal Logic Specifications
该论文提出了一种基于模型的强化学习框架,利用信号时序逻辑(STL)规范定义机器人的高层行为,替代传统的奖励函数。该方法训练一个深度神经网络以预测系统轨迹,并在滚动时域内采用基于进化策略的优化方法,选择能最大化STL鲁棒性的动作,从而在机器人操作和自动驾驶任务中实现了更高的样本效率和安全性。
Techniques based on Reinforcement Learning (RL) are increasingly being used to design control policies for robotic systems. RL fundamentally relies on state-based reward functions to encode desired behavior of the robot and bad reward functions are prone to exploitation by the learning agent, leading to behavior that is undesirable in the best case and critically dangerous in the worst. On the other hand, designing good reward functions for complex tasks is a challenging problem. In this paper, we propose expressing desired high-level robot behavior using a formal specification language known as Signal Temporal Logic (STL) as an alternative to reward/cost functions. We use STL specifications in conjunction with model-based learning to design model predictive controllers that try to optimize the satisfaction of the STL specification over a finite time horizon. The proposed algorithm is empirically evaluated on simulations of robotic system such as a pick-and-place robotic arm, and adaptive cruise control for autonomous vehicles.
研究动机与目标
- 为解决强化学习中设计有效且安全的奖励函数所面临的挑战,因为传统奖励函数容易出现奖励欺骗和泛化能力差的问题。
- 通过使用表达能力强的形式语言(如信号时序逻辑,STL)实现机器人中的高层任务规范,确保行为的正确性和安全性。
- 通过利用基于模型的学习方法和预测动力学模型,提升强化学习中的样本效率。
- 将形式化验证概念(STL鲁棒性)整合到模型预测控制中,以实现更安全、更可靠的策略合成。
- 在复杂的机器人任务(如抓取与放置、自适应巡航控制)上验证该方法,展示其可扩展性和鲁棒性。
提出的方法
- 训练一个深度神经网络(DNN)以从状态-动作轨迹数据中学习系统动力学的确定性预测模型。
- 该预测模型可为任意给定的控制动作序列生成有限时域的轨迹。
- 基于STL的定量语义(鲁棒性)设计一个代价函数,用于评估预测轨迹的质量。
- 使用基于进化策略的在线黑箱优化器,搜索能最小化STL代价函数的最优动作序列。
- 以滚动时域模型预测控制的方式,将优化序列中的第一个动作应用于系统,并在每个时间步重复该过程。
- 该方法结合了基于模型的学习与基于形式规范的优化,避免了人工设计的奖励函数。
实验结果
研究问题
- RQ1STL规范能否在不依赖人工设计奖励函数的前提下,有效定义复杂的机器人行为?
- RQ2如何通过形式规范增强基于模型的强化学习,以提升样本效率和安全性?
- RQ3在复杂任务中,基于预测轨迹的进化策略优化能否优于传统的基于奖励的强化学习?
- RQ4将STL鲁棒性作为代价函数在多大程度上能提升控制器的可靠性并减少奖励欺骗?
- RQ5所提出的方法在真实世界机器人和自动驾驶车辆控制任务中的可扩展性如何?
主要发现
- 所提出的方法成功合成了无需依赖人工设计奖励函数的安全且高效的机器人控制策略。
- 使用STL鲁棒性作为代价函数使控制器能够优先满足高层的时间和逻辑约束。
- 基于DNN动力学模型与进化优化的模型方法在样本效率方面优于标准的无模型强化学习方法。
- 在抓取与放置机械臂和自适应巡航控制任务上的实证评估表明,系统在多种初始条件下均表现出稳定且正确的行为。
- 通过在优化目标中直接编码任务规范的形式逻辑,该方法有效抑制了奖励欺骗现象。
- 将STL语义整合到MPC中,使得所合成的控制器在系统动力学和初始状态存在微小扰动时,具有可证明的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。