[论文解读] Rethinking Goal-conditioned Supervised Learning and Its Connection to Offline RL
该论文提出加权GCSL(WGCSL),一种离线目标条件强化学习方法,通过引入结合折扣重标注权重、基于价值函数估计的目标条件指数优势权重以及最优优势权重的复合加权方案,对目标条件监督学习(GCSL)进行了改进。WGCSL可证明地优化了目标达成目标函数的更紧下界,并在在线与离线设置下均实现了单调策略提升,在包含复杂机器人操作任务的新基准上优于GCSL和当前最先进(SOTA)的离线强化学习方法。
Solving goal-conditioned tasks with sparse rewards using self-supervised learning is promising because of its simplicity and stability over current reinforcement learning (RL) algorithms. A recent work, called Goal-Conditioned Supervised Learning (GCSL), provides a new learning framework by iteratively relabeling and imitating self-generated experiences. In this paper, we revisit the theoretical property of GCSL -- optimizing a lower bound of the goal reaching objective, and extend GCSL as a novel offline goal-conditioned RL algorithm. The proposed method is named Weighted GCSL (WGCSL), in which we introduce an advanced compound weight consisting of three parts (1) discounted weight for goal relabeling, (2) goal-conditioned exponential advantage weight, and (3) best-advantage weight. Theoretically, WGCSL is proved to optimize an equivalent lower bound of the goal-conditioned RL objective and generates monotonically improved policies via an iterated scheme. The monotonic property holds for any behavior policies, and therefore WGCSL can be applied to both online and offline settings. To evaluate algorithms in the offline goal-conditioned RL setting, we provide a benchmark including a range of point and simulated robot domains. Experiments in the introduced benchmark demonstrate that WGCSL can consistently outperform GCSL and existing state-of-the-art offline methods in the fully offline goal-conditioned setting.
研究动机与目标
- 为解决GCSL在离线设置下因对重标注经验采用统一加权而导致的次优性能问题。
- 为离线目标条件强化学习建立一个理论基础坚实、支持单调策略提升的框架。
- 弥合目标条件设置下监督模仿学习与离线强化学习之间的差距。
- 设计一个包含多样化、具有挑战性的多目标机器人环境的基准,用于评估离线目标条件强化学习算法。
提出的方法
- 通过引入折扣奖励,重新审视GCSL的理论基础,推导出加权监督学习目标。
- 在WGCSL中引入由三部分组成的复合权重:用于目标重标注的折扣权重、基于价值函数估计的指数优势权重,以及用于多模态数据的最优优势权重。
- 证明WGCSL优化了目标条件强化学习目标的等价下界,确保在任意行为策略下均实现单调策略提升。
- 使用价值函数估计优势并指导指数加权,提升学习效率与策略质量。
- 将加权模仿学习方案应用于离线数据集,实现在无需在线交互情况下的稳定且高效的策略学习。
- 设计了一个包含8个环境的综合性基准,涵盖质点模型和机器人操作任务,使用真实世界与合成数据集。
实验结果
研究问题
- RQ1加权模仿学习框架是否能提升GCSL在离线目标条件强化学习设置下的性能?
- RQ2所提出的加权方案是否能在多种行为策略下实现单调策略提升?
- RQ3基于价值函数的优势加权集成如何提升离线目标条件强化学习的学习效率与最终性能?
- RQ4WGCSL在复杂多目标机器人任务上相较于现有SOTA离线强化学习方法的性能提升程度如何?
- RQ5WGCSL是否能有效泛化到高度多模态且稀疏奖励的环境(如具有人形手部的环境)?
主要发现
- 在所引入基准的所有环境中,WGCSL始终优于GCSL和当前最先进(SOTA)的离线强化学习基线方法,尤其在具有挑战性的HandReach任务中表现突出。
- 在人形手部环境中,当从随机收集的稀疏奖励数据集中训练时,WGCSL的完成率显著高于GCSL和其他SOTA方法。
- 引入最优优势权重可提升多模态数据场景下的渐近性能,此类场景中存在多条通往目标的有效轨迹。
- 与GCSL相比,复合加权方案在目标达成目标函数上实现了更紧的下界,为性能提升提供了理论依据。
- WGCSL在所有评估设置中均表现出单调策略提升,无论用于收集离线数据的行为策略为何。
- 实证结果证实,学习价值函数以进行优势估计是值得的,因为性能增益超过了额外的训练成本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。