Skip to main content
QUICK REVIEW

[论文解读] Learning Goal-Conditioned Policies Offline with Self-Supervised Reward Shaping

Lina Mezghani, Sainbayar Sukhbaatar|arXiv (Cornell University)|Jan 5, 2023
Intelligent Tutoring Systems and Adaptive Learning被引用 4
一句话总结

本文提出了一种用于离线目标条件强化学习的自监督奖励塑形方法,该方法从预先收集的轨迹中学习密集奖励,而无需任何人工设计的奖励。通过训练可达性网络、提取代表性状态并构建状态空间图,该方法实现了长时程策略的高效学习,在连续控制任务(包括UMaze、RoboYoga Walker和Pusher)上显著优于先前的 hindsight 重标记基线方法。

ABSTRACT

Developing agents that can execute multiple skills by learning from pre-collected datasets is an important problem in robotics, where online interaction with the environment is extremely time-consuming. Moreover, manually designing reward functions for every single desired skill is prohibitive. Prior works targeted these challenges by learning goal-conditioned policies from offline datasets without manually specified rewards, through hindsight relabelling. These methods suffer from the issue of sparsity of rewards, and fail at long-horizon tasks. In this work, we propose a novel self-supervised learning phase on the pre-collected dataset to understand the structure and the dynamics of the model, and shape a dense reward function for learning policies offline. We evaluate our method on three continuous control tasks, and show that our model significantly outperforms existing approaches, especially on tasks that involve long-term planning.

研究动机与目标

  • 从预先收集的数据集中无监督地学习多任务目标条件策略,无需任何奖励工程。
  • 解决先前离线强化学习方法在长时程任务中因稀疏奖励而阻碍策略学习的挑战。
  • 开发一种自监督阶段,从轨迹中学习环境动态和结构,以塑造密集且有意义的奖励。
  • 在低质量数据集(如使用随机策略收集的数据集)上实现有效的策略训练,无需专家演示。
  • 在流程的任何阶段均无需额外的环境交互或手动设计的奖励函数。

提出的方法

  • 训练一个可达性网络,利用离线数据集中的转移样本估计状态空间中的局部距离。
  • 提取一组覆盖状态空间的代表性状态,作为全局距离近似的目标地标。
  • 在代表性状态上构建图,通过最短路径计算建模状态空间中的全局距离。
  • 利用该图在策略训练期间基于到目标的最短路径距离生成密集奖励。
  • 通过图路径上的中间转移样本增强数据集,以提升策略泛化能力和训练稳定性。
  • 使用自监督生成的密集奖励和增强的转移样本训练目标条件策略,无需任何奖励函数或环境交互。

实验结果

研究问题

  • RQ1从离线轨迹中进行自监督表征学习是否能够实现无需人工设计奖励的密集奖励塑形?
  • RQ2密集奖励塑形是否能提升长时程目标条件控制任务的学习效率和性能?
  • RQ3该方法是否能从低质量数据集(如使用随机策略收集的数据集)中训练出有效策略?
  • RQ4与HER和Actionable Models等hindsight重标记基线相比,该方法在离线目标条件强化学习中的表现如何?
  • RQ5该方法是否能在数据收集或训练过程中完全无奖励监督的情况下,泛化到复杂连续控制环境中?

主要发现

  • 在UMaze任务中,该方法显著优于HER和Actionable Models,尤其在目标远离初始状态时表现更优,证明了其在长时程规划方面的优势。
  • 在RoboYoga Walker任务中,该方法性能优于基线方法,而Actionable Models未能超越标准HER,表明其具有更好的样本效率和泛化能力。
  • 在Pusher任务中,该方法在平均距离、手部距离和滑块距离上均优于所有基线,显示出精确且有序的控制能力。
  • 即使在使用随机策略收集的数据集上,该方法也能学习到有效策略,证明了其对低质量数据的鲁棒性,并消除了对专家演示的需求。
  • 基于图的密集奖励塑形相比稀疏奖励方法能实现更快的收敛和更稳定的训练,尤其在复杂环境中表现更优。
  • 该方法是首个在任何阶段(数据收集、训练或评估)均无需任何奖励函数的完全无监督离线目标条件策略学习方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。