[论文解读] Near-Optimal Representation Learning for Hierarchical Reinforcement Learning
本文提出了一个用于目标条件层级强化学习表示的次优性度量,推导出表示质量与策略性能之间的界限,并提出可行的学习目标,能够获得近似最优的层级策略。
We study the problem of representation learning in goal-conditioned hierarchical reinforcement learning. In such hierarchical structures, a higher-level controller solves tasks by iteratively communicating goals which a lower-level policy is trained to reach. Accordingly, the choice of representation -- the mapping of observation space to goal space -- is crucial. To study this problem, we develop a notion of sub-optimality of a representation, defined in terms of expected reward of the optimal hierarchical policy using this representation. We derive expressions which bound the sub-optimality and show how these expressions can be translated to representation learning objectives which may be optimized in practice. Results on a number of difficult continuous-control tasks show that our approach to representation learning yields qualitatively better representations as well as quantitatively better hierarchical policies, compared to existing methods (see videos at https://sites.google.com/view/representation-hrl).
研究动机与目标
- 在目标条件层级 RL 中激励表示学习,以在状态压缩与子任务表达能力之间取得平衡。
- 基于给定表示下最优层级策略的奖励,定义一个正式的次优性度量。
- 推导界限,显示表示选择如何影响层级策略的表现,并将其与实际的学习目标联系起来。
- 提出一个表示学习目标和辅助的逆模型,界定次优性并可在实践中优化。
提出的方法
- 建立一个两层级的层级策略,高层在学习到的表示空间中选择目标,低层执行动作以达到该目标。
- 引入将状态-目标对映射到更低层行为的映射 Psi,并分析相对于完全表达能力基线的差距所引起的次优性。
- 推导理论界线(定理1和3,命题2和4),将 SubOpt(Psi) 与真实动力学与表示基动力学之间的发散联系起来。
- 基于真实下一个状态分布与通过距离函数 D 的能量模型 K 之间的 KL/散度,定义一个表示学习目标。
- 开发一个可实操的训练目标(方程式11–15),优化表示 f 和辅助模型 varphi 以界定次优性。
- 将框架扩展到时序抽象(c>1)和广义策略(方程9),并给出相应界限。
实验结果
研究问题
- RQ1当使用固定的下层映射 Psi 时,表示 f 的选择如何影响层级策略的次优性?
- RQ2我们能否界定由于表示引入的约束导致的回报损失,并将此界限转化为一个实践的表示学习目标?
- RQ3时序抽象(c > 1)如何影响次优性界限和可学习的表示?
- RQ4互信息基础的目标与所提出的层级 RL 表示学习界限之间的关系是什么?
- RQ5在挑战性的连续控制任务中,学习得到的表示是否能够接近最优性能,与使用完整状态或 oracle 表示相比?
主要发现
- 具有原理性界限的表示学习目标可产生得到的层级策略,其回报在一个有界误差内接近最优策略。
- 该框架将表示学习直接与次优性联系起来,促进可用的训练目标,从而减少状态到目标映射中的信息损失。
- 在连续控制任务上的实证结果显示相对于基线的定性和定量收益,包括在图像观测情景中的优势。
- 学习得到的表示倾向于强调与任务相关的坐标(例如方块位置)而非其他坐标,与你的奖励结构相一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。