Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Domain Adaptation with Dynamics-Aware Rewards in Reinforcement Learning

Jinxin Liu, Hao Shen|arXiv (Cornell University)|Oct 25, 2021
Domain Adaptation and Few-Shot Learning被引用 4
一句话总结

本文提出 DARS,一种用于无监督强化学习的领域自适应方法,可在存在动力学变化的情况下,实现从源环境到目标环境的高效技能迁移。通过引入一种 KL 正则化的奖励函数,使源环境与目标环境的行为对齐,DARS 仅需在目标环境中进行少量轨迹采样,即可发现适应性强且可迁移的技能,其性能与在目标环境中的完整训练相当,同时将真实世界交互时间减少高达 75%。

ABSTRACT

Unsupervised reinforcement learning aims to acquire skills without prior goal representations, where an agent automatically explores an open-ended environment to represent goals and learn the goal-conditioned policy. However, this procedure is often time-consuming, limiting the rollout in some potentially expensive target environments. The intuitive approach of training in another interaction-rich environment disrupts the reproducibility of trained skills in the target environment due to the dynamics shifts and thus inhibits direct transferring. Assuming free access to a source environment, we propose an unsupervised domain adaptation method to identify and acquire skills across dynamics. Particularly, we introduce a KL regularized objective to encourage emergence of skills, rewarding the agent for both discovering skills and aligning its behaviors respecting dynamics shifts. This suggests that both dynamics (source and target) shape the reward to facilitate the learning of adaptive skills. We also conduct empirical experiments to demonstrate that our method can effectively learn skills that can be smoothly deployed in target.

研究动机与目标

  • 为解决在昂贵的真实世界目标环境中部署策略时样本成本过高的挑战。
  • 在源环境中实现无监督技能发现,同时确保可迁移至存在动力学变化的目标环境。
  • 在无需预先提供奖励函数或目标标注的情况下,减少目标环境中所需的轨迹采样次数。
  • 开发一种基于源环境与目标环境动力学的奖励机制,以引导技能发现。
  • 实现复杂机器人技能在仿真到真实环境中的鲁棒迁移,且真实世界交互次数极少。

提出的方法

  • 引入 KL 正则化项,修改目标达成奖励函数,以对齐源环境与目标环境的轨迹。
  • 在源环境中使用潜在条件化的探测策略来表示目标,并学习目标分布与奖励函数。
  • 仅在源环境中使用动力学感知奖励训练目标条件策略。
  • 使用两个分类器估计源环境与目标环境状态分布之间的 KL 散度,从而实现基于动力学不匹配的奖励塑造。
  • 在源环境中利用现成的无监督强化学习方法(例如 GPIM)学习可泛化至目标环境的策略。
  • 在微调实验中复用目标环境的轨迹缓冲区,以评估数据效率。

实验结果

研究问题

  • RQ1是否可以仅通过少量目标环境中的轨迹采样,将已在源环境中经过丰富采样的策略有效适应至存在动力学变化的目标环境?
  • RQ2如何显式建模源环境与目标环境之间的动力学差异,以指导技能发现?
  • RQ3无监督强化学习中的领域自适应能否在无需预先奖励函数的情况下,实现与在目标环境中完整训练相当的性能?
  • RQ4所提出的 KL 正则化奖励是否能提升学习技能在不稳定或仿真到真实设置下的鲁棒性与可迁移性?
  • RQ5在保持技能性能的前提下,可将所需真实世界轨迹采样次数减少到何种程度?

主要发现

  • DARS 在仅 100 万步内实现了与在目标环境中完整训练(GPIM)相当的性能,同时显著减少了目标环境中的轨迹采样次数。
  • 在相同目标环境采样次数下,DARS 的表现优于在目标环境中使用 10 倍更新次数和微调基线的 GPIM,展现出优异的数据效率。
  • 在保持平衡的任务中,DARS 将真实世界训练时间从微调方法的 4 小时减少至 1 小时,同时在 3 小时内成功学习前后运动技能,而基线方法在 6 小时内未能收敛。
  • 在不稳定环境中,DARS 仍能学习到稳定且可重复的技能,而 SMiRL 及其微调变体因动力学不匹配而无法适应。
  • 复用目标缓冲区并未显著提升性能,表明 KL 正则化已提供足够的归纳偏置以支持有效适应。
  • DARS 在仿真到真实迁移中实现了接近最优的性能,且真实世界交互极少,验证了其在真实世界部署中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。