[论文解读] Information Theoretic Model Predictive Q-Learning
该论文提出了一种新型算法——模型预测Q学习(MPQ),将信息论的模型预测控制(MPC)与熵正则化Q学习相结合,以提升强化学习中的样本效率和鲁棒性。通过使用真实世界轨迹训练Q函数,同时利用MPC实现稳定、长时程的规划,MPQ在存在模型偏差和稀疏奖励的情况下,仍能实现比MPC和软Q学习更快的收敛速度和更优的性能表现。
Model-free Reinforcement Learning (RL) works well when experience can be collected cheaply and model-based RL is effective when system dynamics can be modeled accurately. However, both assumptions can be violated in real world problems such as robotics, where querying the system can be expensive and real-world dynamics can be difficult to model. In contrast to RL, Model Predictive Control (MPC) algorithms use a simulator to optimize a simple policy class online, constructing a closed-loop controller that can effectively contend with real-world dynamics. MPC performance is usually limited by factors such as model bias and the limited horizon of optimization. In this work, we present a novel theoretical connection between information theoretic MPC and entropy regularized RL and develop a Q-learning algorithm that can leverage biased models. We validate the proposed algorithm on sim-to-sim control tasks to demonstrate the improvements over optimal control and reinforcement learning from scratch. Our approach paves the way for deploying reinforcement learning algorithms on real systems in a systematic manner.
研究动机与目标
- 为解决模型自由强化学习(样本效率低下)与模型基于强化学习(模型偏差)在真实世界机器人应用中的局限性。
- 在真实世界交互成本高昂且动力学模型不完善的控制任务中,提升样本效率与鲁棒性。
- 开发一种方法,利用真实世界数据纠正模型偏差,同时保留MPC的规划优势。
- 证明从真实系统轨迹中学习Q函数可优于领域随机化与模型基基线方法。
提出的方法
- 建立了信息论MPC与熵正则化强化学习之间的理论联系,从而构建统一的策略优化框架。
- 使用带有偏差模型的MPC生成轨迹作为Q函数的目标值,实现从真实世界交互中稳定高效的学习。
- 采用熵正则化以促进探索,并防止训练过程过早收敛。
- 利用真实系统轨迹训练Q函数,使方法能够适应真实动力学,降低模型偏差。
- 通过利用学习到的Q函数中的全局信息,实现MPC规划时域的截断,提升计算效率。
- 通过使用MPC生成的目标值,避免使用目标网络,简化训练过程并提升稳定性。
实验结果
研究问题
- RQ1从真实世界轨迹中学习的Q函数能否克服基于MPC控制中的模型偏差?
- RQ2将MPC与熵正则化Q学习结合,是否能相比模型自由强化学习提升样本效率?
- RQ3在稀疏奖励与不完美模型的任务中,MPQ能否在性能上优于MPC与软Q学习?
- RQ4当真实系统参数已知时,MPQ与领域随机化在模拟到模拟迁移中的表现如何比较?
- RQ5MPQ能否在不牺牲性能的前提下,有效截断MPC的规划时域?
主要发现
- 在FetchPushBlock与FrankaDrawerOpen任务中,MPQ使用短时域(H=10)的性能优于MPPI使用长时域(H=64)的性能,后者在FrankaDrawerOpen任务中的成功率高出5倍以上。
- 在BallInCupSparse任务中,MPQ使用H=4与真实世界轨迹的配置,实现了85%的成功率,而基于DR的训练仅达到41%。
- 在FrankaDrawerOpen任务中,MPQ使用真实世界轨迹的配置达到53%的成功率,而DR基线仅实现17%。
- MPQ在真实系统交互几分钟内即收敛至稳定策略,而软Q学习在相同任务中未能实现一致收敛。
- 使用H=10的MPQ性能优于使用真实动力学与H=64的MPPI,证明了Q函数全局信息的优势。
- 该方法因Q函数具备泛化长时域效应的能力,可实现时域截断,从而降低计算成本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。