Skip to main content
QUICK REVIEW

[论文解读] Fast Adaptation via Policy-Dynamics Value Functions

Roberta Răileanu, Max A. Goldstein|arXiv (Cornell University)|Jul 6, 2020
Reinforcement Learning in Robotics参考文献 56被引用 9
一句话总结

本文提出策略-动态价值函数(PD-VF),通过从离线轨迹中学习策略和环境的嵌入表示,实现强化学习中对新环境动态的快速适应。通过训练一个基于这些嵌入的条件价值函数,PD-VF 仅需少量环境交互即可实现快速策略选择,在未见过动态的 MuJoCo 连续控制任务中,性能优于元学习与迁移学习基线方法。

ABSTRACT

Standard RL algorithms assume fixed environment dynamics and require a significant amount of interaction to adapt to new environments. We introduce Policy-Dynamics Value Functions (PD-VF), a novel approach for rapidly adapting to dynamics different from those previously seen in training. PD-VF explicitly estimates the cumulative reward in a space of policies and environments. An ensemble of conventional RL policies is used to gather experience on training environments, from which embeddings of both policies and environments can be learned. Then, a value function conditioned on both embeddings is trained. At test time, a few actions are sufficient to infer the environment embedding, enabling a policy to be selected by maximizing the learned value function (which requires no additional environment interaction). We show that our method can rapidly adapt to new dynamics on a set of MuJoCo domains. Code available at https://github.com/rraileanu/policy-dynamics-value-functions.

研究动机与目标

  • 解决在环境动态与训练分布不同时,强化学习中快速适应的挑战。
  • 克服标准强化学习智能体因过度拟合特定环境特性而无法泛化至微小扰动的局限。
  • 在无需完整轨迹或额外环境交互的前提下,实现在未见环境中的快速策略选择。
  • 学习一个建模策略、环境动态与预期回报之间关系的价值函数,适用于多样化动态场景。
  • 构建一个可在复杂控制任务中泛化于连续与离散动态变化的框架。

提出的方法

  • 在多样化的训练环境中训练一组标准强化学习策略,以生成轨迹。
  • 利用这些轨迹进行自监督学习,将策略行为与环境动态联合嵌入为低维表示。
  • 使用初始状态、策略嵌入与环境嵌入作为输入,以真实累积回报为目标,训练监督式价值函数。
  • 测试时,仅通过前几轮环境交互即可推断出环境嵌入。
  • 通过在策略嵌入空间上最大化学习到的价值函数,选择最优策略,无需进一步环境交互。
  • 使用选定的策略在新环境中执行,实现仅需极少样本复杂度的快速适应。

实验结果

研究问题

  • RQ1基于策略与环境嵌入的条件价值函数,是否能在连续控制任务中实现对未见环境动态的快速适应?
  • RQ2与标准元学习与迁移学习方法相比,PD-VF 在新动态上的泛化能力如何?
  • RQ3仅通过少量环境交互,是否足以推断环境嵌入并选择高性能策略?
  • RQ4在建模非最优策略的同时,是否能提升在不同动态间的泛化能力?
  • RQ5学习到的策略-动态嵌入空间是否能捕捉行为与环境动态之间有意义的结构关系?

主要发现

  • 在未见过动态的 MuJoCo 环境中,PD-VF 显著优于元学习与迁移学习基线方法,尤其在早期适应阶段表现突出。
  • 在 Swimmer 任务中,PD-VF 在最后一个环境(E10)上达到平均回报 203.95,领先第二好的方法超过 30 分。
  • 在 Spaceship 任务中,PD-VF 在 E10 上取得 196.18 的回报,展现出在多样化动态中的强大泛化能力。
  • 该方法仅需极少环境交互即可实现高性能——仅需几步即可完成新环境的嵌入推断与策略选择。
  • 基于策略-动态嵌入训练的价值函数能泛化于连续与离散动态变化,对扰动具有鲁棒性。
  • PD-VF 成功在无需完整轨迹的情况下对策略进行排序,实现低反馈或高成本环境中的快速推理与部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。