[论文解读] Multi-objective Model-based Policy Search for Data-efficient Learning with Sparse Rewards
该论文提出 Multi-DEX,一种多目标基于模型的策略搜索算法,通过将新颖性驱动探索与基于模型的优化相结合,高效解决稀疏奖励强化学习任务。通过使用基于帕累托最优的进化算法,同时优化轨迹新颖性、累积奖励和模型准确性,Multi-DEX 在摆杆倒立任务中仅用不到 100 次试验,在 4-DOF 抽屉开启任务中仅用不到 1,000 次试验即达到高性能,优于 VIME、TRPO、GEP-PG、CMA-ES 和 Black-DROPS。
The most data-efficient algorithms for reinforcement learning in robotics are model-based policy search algorithms, which alternate between learning a dynamical model of the robot and optimizing a policy to maximize the expected return given the model and its uncertainties. However, the current algorithms lack an effective exploration strategy to deal with sparse or misleading reward scenarios: if they do not experience any state with a positive reward during the initial random exploration, it is very unlikely to solve the problem. Here, we propose a novel model-based policy search algorithm, Multi-DEX, that leverages a learned dynamical model to efficiently explore the task space and solve tasks with sparse rewards in a few episodes. To achieve this, we frame the policy search problem as a multi-objective, model-based policy optimization problem with three objectives: (1) generate maximally novel state trajectories, (2) maximize the expected return and (3) keep the system in state-space regions for which the model is as accurate as possible. We then optimize these objectives using a Pareto-based multi-objective optimization algorithm. The experiments show that Multi-DEX is able to solve sparse reward scenarios (with a simulated robotic arm) in much lower interaction time than VIME, TRPO, GEP-PG, CMA-ES and Black-DROPS.
研究动机与目标
- 为解决强化学习中稀疏或欺骗性奖励带来的数据效率挑战,标准基于模型的算法因缺乏初始正向奖励而失效。
- 通过在基于模型的策略搜索中整合内在好奇心与新颖性驱动行为,提升稀疏奖励环境中的探索能力。
- 通过利用学习到的动力学模型引导策略优化,实现高回报与高探索潜力的平衡,从而减少与真实世界系统的交互时间。
- 通过将模型不确定性纳入优化目标,保持在未探索区域的高模型准确性。
- 证明在新颖性、奖励与模型置信度之间进行多目标优化,可实现比单目标或纯探索方法更快的收敛速度。
提出的方法
- 将策略搜索建模为一个包含三个目标的多目标优化问题:最大化轨迹新颖性、累积奖励和模型准确性(最小化不确定性)。
- 使用高斯过程(GP)从交互数据中学习系统的概率动力学模型。
- 应用基于帕累托最优的多目标进化算法(MOEA)生成一组在三个目标间实现非支配平衡的策略。
- 通过一个标量化的参数 ε 从帕累托集中选择最终策略,以控制探索与利用之间的权衡。
- 采用一种基于回合的交互循环:收集轨迹 → 学习 GP 模型 → 优化多目标策略 → 选择并执行新策略。
- 通过状态空间新颖性(即潜在空间或观测空间中与先前访问状态的距离)实现内在好奇心。
实验结果
研究问题
- RQ1基于模型的策略搜索算法是否能在不依赖初始正向奖励的情况下,有效探索稀疏奖励环境?
- RQ2在强化学习中,对新颖性、奖励与模型不确定性的多目标优化如何提升数据效率?
- RQ3基于帕累托最优的方法是否在样本效率方面优于单目标或贪婪优化方法,在具有挑战性的控制任务中表现更优?
- RQ4将内在好奇心整合到基于模型的学习中,如何影响收敛速度与最终性能?
- RQ5所提出的方法是否在非稀疏奖励任务中也保持强性能,同时在稀疏任务中表现卓越?
主要发现
- Multi-DEX 仅用 100 次试验(约 6.6 分钟交互时间)即解决了具有欺骗性奖励结构的摆杆倒立任务,获得高且稳定的正向奖励。
- 相比之下,GEP-PG 和 TRPO-VIME 即使在 2,500 次试验后也未能达到可比性能,而 TRPO、Black-DROPS 和 CMA-ES 因缺乏定向探索,始终维持在接近零的奖励水平。
- 在 4-DOF 抽屉开启任务中,Multi-DEX 在中位数 1,000 次试验内实现完整任务成功,而 CMA-ES 在相同预算下仅达到一半的最终奖励。
- 在 5-DOF 机械臂的非稀疏目标到达任务中,Multi-DEX 的两种变体(ε=0 和 ε=0.4)均达到与标准 Black-DROPS 竞争相当的性能,证明其在不同奖励稀疏程度下的鲁棒性。
- 由 Multi-DEX 生成的帕累托最优策略集提供了多样化的行为,通过 ε 参数选择最终策略,可实现探索与利用之间的动态调整。
- 将模型不确定性整合到目标函数中,提升了泛化能力,减少了对随机探索的依赖,显著降低了样本复杂度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。