Skip to main content
QUICK REVIEW

[论文解读] VPE: Variational Policy Embedding for Transfer Reinforcement Learning

Isac Arnekvist, Danica Kragić|arXiv (Cornell University)|Sep 10, 2018
Reinforcement Learning in Robotics被引用 3
一句话总结

本文提出变分策略嵌入(VPE),一种用于迁移强化学习的方法,通过从一类相似的马尔可夫决策过程(MDP)中的教师策略中学习Q函数的低维潜在空间,实现高效策略迁移。通过在该潜在空间中使用变分推断与贝叶斯优化进行策略适应的优化,VPE 实现了在新环境中的快速、数据高效适应——在模拟环境和真实世界机器人推物任务中,仅需5至10分钟的真实环境轨迹即可完成。

ABSTRACT

Reinforcement Learning methods are capable of solving complex problems, but resulting policies might perform poorly in environments that are even slightly different. In robotics especially, training and deployment conditions often vary and data collection is expensive, making retraining undesirable. Simulation training allows for feasible training times, but on the other hand suffers from a reality-gap when applied in real-world settings. This raises the need of efficient adaptation of policies acting in new environments. We consider this as a problem of transferring knowledge within a family of similar Markov decision processes. For this purpose we assume that Q-functions are generated by some low-dimensional latent variable. Given such a Q-function, we can find a master policy that can adapt given different values of this latent variable. Our method learns both the generative mapping and an approximate posterior of the latent variables, enabling identification of policies for new tasks by searching only in the latent space, rather than the space of all policies. The low-dimensional space, and master policy found by our method enables policies to quickly adapt to new environments. We demonstrate the method on both a pendulum swing-up task in simulation, and for simulation-to-real transfer on a pushing task.

研究动机与目标

  • 为解决在部署策略至略有不同的环境时强化学习泛化能力差的问题,特别是在数据收集成本高昂的机器人领域。
  • 在无需完整重训练的前提下,实现策略在相似环境族中新的 MDP 的高效适应。
  • 学习最优策略的紧凑且解耦的潜在表征,以捕捉环境变化。
  • 通过在潜在空间中进行全局优化而非在完整策略空间中优化,实现快速策略适应。
  • 通过统一的变分推断框架,支持从随机和确定性教师策略进行迁移。

提出的方法

  • 该方法将 MDP 族建模为由低维潜在变量 z 参数化,Q 函数通过深度生成模型从 z 生成。
  • 采用变分推断框架近似 z 的后验分布,并推导出用于端到端训练的证据下界(ELBO)。
  • 主策略以 z 为条件,训练目标为对每个 z 产生最大化期望回报的动作,从而实现策略迁移。
  • 通过在潜在空间中使用贝叶斯优化或随机梯度下降优化 z,实现对新 MDP 的策略适应,避免完整策略重训练。
  • 该方法学习到一个解耦的潜在空间,其中各维度对应有意义的环境参数,经信噪比(SNR)分析验证。
  • 通过统一的变分目标,框架可同时支持确定性和随机教师策略。

实验结果

研究问题

  • RQ1能否学习到一个低维潜在空间,以捕捉相似环境族中 MDP 的变化?
  • RQ2能否训练一个主策略,在该潜在空间中泛化并实现对新 MDP 的快速适应?
  • RQ3潜在空间是否能解耦出有意义的环境参数(如质量或摩擦系数),实现可解释的策略适应?
  • RQ4该方法能否在极少真实交互的前提下,实现从仿真到真实世界机器人任务的有效迁移?
  • RQ5潜在空间优化的性能与在高维动作/状态空间中直接策略优化相比如何?

主要发现

  • 在摆动倒立摆任务中,VPE 仅经过3次优化步骤,即在未见过的 MDP 上达到 -121.5 ± 2.2 的回报,显著优于基线方法。
  • 在仿真到真实世界的推物任务中,通过在潜在空间中使用贝叶斯优化,方法在仅 5 至 10 分钟真实环境轨迹后即实现成功策略迁移。
  • 潜在空间表现出清晰的解耦性,信噪比(SNR)最高的维度编码了推物任务中的旋转偏移参数 x_rot。
  • 该方法将策略适应的有效搜索空间从完整策略空间缩减至低维潜在空间,实现了高效优化。
  • 变分推断框架成功压缩了后验分布,潜在变量更趋近于先验分布,证实了有效的压缩与泛化能力。
  • 即使教师策略仅在有限的环境变化范围内训练,该方法仍能很好地泛化到未见过的 MDP,展现出强大的零样本迁移能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。