Skip to main content
QUICK REVIEW

[论文解读] SimGAN: Hybrid Simulator Identification for Domain Adaptation via Adversarial Reinforcement Learning

Yifeng Jiang, Tingnan Zhang|arXiv (Cornell University)|Jan 15, 2021
Reinforcement Learning in Robotics参考文献 44被引用 11
一句话总结

SimGAN 提出了一种对抗性强化学习框架,用于识别能够匹配真实世界轨迹分布的混合物理模拟器,通过学习到的基于 GAN 的损失函数消除人工设计损失的需要,从而提升模拟到真实世界的策略迁移性能。该方法在仅使用 50 条目标轨迹的情况下,仅依赖极少的真实世界数据,在六个机器人运动任务上均优于强基线模型,实现了高性能策略。

ABSTRACT

As learning-based approaches progress towards automating robot controllers design, transferring learned policies to new domains with different dynamics (e.g. sim-to-real transfer) still demands manual effort. This paper introduces SimGAN, a framework to tackle domain adaptation by identifying a hybrid physics simulator to match the simulated trajectories to the ones from the target domain, using a learned discriminative loss to address the limitations associated with manual loss design. Our hybrid simulator combines neural networks and traditional physics simulation to balance expressiveness and generalizability, and alleviates the need for a carefully selected parameter set in System ID. Once the hybrid simulator is identified via adversarial reinforcement learning, it can be used to refine policies for the target domain, without the need to interleave data collection and policy refinement. We show that our approach outperforms multiple strong baselines on six robotic locomotion tasks for domain adaptation.

研究动机与目标

  • 为解决模拟到真实世界策略迁移的挑战,即模拟与真实世界动力学之间的领域差异会阻碍策略性能。
  • 消除对模拟与真实轨迹之间相似性损失的人工设计需求,这些损失通常具有启发式且不切实际。
  • 通过识别结合可微神经网络与经典物理模型的混合模拟器,提升模拟保真度,增强表达能力而不损失泛化性。
  • 通过仅使用有限的真实世界数据一次学习模拟器,实现高效的领域自适应,避免迭代式数据收集与策略优化循环。
  • 证明所学习模拟器在多种运动技能和环境中的泛化能力,即使奖励函数发生变化。

提出的方法

  • 将模拟器识别建模为对抗性强化学习问题,其中 GAN 判别器用于区分真实世界轨迹与模拟轨迹。
  • 利用 GAN 学习到的判别性损失为轨迹分布提供弱监督,避免对成对轨迹或启发式距离度量的依赖。
  • 构建一个混合模拟器,用可微的、与状态-动作相关的神经网络函数替代固定的模拟参数,以建模未被建模的动力学。
  • 使用策略梯度方法优化模拟器参数,将参数函数视为一个强化学习智能体,其目标是最大化轨迹的真实性。
  • 仅使用行为策略的真实世界轨迹一次学习模拟器,之后可重复用于新任务的策略优化,无需进一步数据收集。
  • 在模拟器学习过程中引入自适应存活奖励,以提升在具有挑战性环境中的模拟保真度。

实验结果

研究问题

  • RQ1学习到的基于 GAN 的损失是否能有效替代人工设计的相似性度量,以实现模拟与真实轨迹在领域自适应中的匹配?
  • RQ2具有可微的、与状态-动作相关的参数的混合模拟器是否能超越固定参数物理模型,显著提升模拟保真度?
  • RQ3对模拟器进行对抗性强化学习训练是否能实现在极少真实世界数据收集下的鲁棒策略迁移?
  • RQ4一个单一学习到的模拟器是否能支持在目标领域中对多种不同运动技能的策略优化?
  • RQ5该方法对用于模拟器识别的真实世界轨迹的质量与数量有多敏感?

主要发现

  • SimGAN 在六个机器人运动任务上均优于强基线模型,包括 Hopper/Heavy 和 Laikago/Deform,表现出更优的领域自适应性能。
  • 仅使用 50 条真实世界轨迹,该方法在 Hopper/Heavy 环境中实现了平均任务奖励 1686,在 Laikago/Deform 环境中实现了平均奖励 2561,表明在极低数据预算下性能下降极小。
  • 在模拟器学习过程中使用自适应存活奖励显著提升了策略性能,在 Hopper/Heavy 环境中将平均奖励从 1186 提升至 1658。
  • 同一学习到的混合模拟器成功支持了 Laikago 机器人侧向行走策略的训练,表明其在不同运动技能间具有强大的泛化能力。
  • 运行算法的额外迭代并未提升性能,表明当前结合解析物理先验的混合模拟器已对分布偏移具有足够鲁棒性。
  • 直接学习接触力而未施加物理约束,导致性能极差,这是由于引入了能量注入的虚构力,凸显了学习组件中物理一致性的关键作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。