Skip to main content
QUICK REVIEW

[论文解读] Auto-Tuned Sim-to-Real Transfer

Yuqing Du, Olivia Watkins|arXiv (Cornell University)|Apr 15, 2021
Domain Adaptation and Few-Shot Learning参考文献 18被引用 4
一句话总结

该论文提出了一种自动调参方法,仅使用真实世界中的原始RGB视频,即可自动调整仿真系统参数以匹配真实世界动力学,无需状态估计或奖励工程。通过将参数调优问题重构为搜索问题,并利用搜索参数模型(SPM)预测当前参数是否过高或过低,该方法显著提升了基线领域随机化在模拟到现实迁移任务中的性能,尤其在对动力学敏感的任务(如插销入孔和柜门开启)中表现更优。

ABSTRACT

Policies trained in simulation often fail when transferred to the real world due to the `reality gap' where the simulator is unable to accurately capture the dynamics and visual properties of the real world. Current approaches to tackle this problem, such as domain randomization, require prior knowledge and engineering to determine how much to randomize system parameters in order to learn a policy that is robust to sim-to-real transfer while also not being too conservative. We propose a method for automatically tuning simulator system parameters to match the real world using only raw RGB images of the real world without the need to define rewards or estimate state. Our key insight is to reframe the auto-tuning of parameters as a search problem where we iteratively shift the simulation system parameters to approach the real-world system parameters. We propose a Search Param Model (SPM) that, given a sequence of observations and actions and a set of system parameters, predicts whether the given parameters are higher or lower than the true parameters used to generate the observations. We evaluate our method on multiple robotic control tasks in both sim-to-sim and sim-to-real transfer, demonstrating significant improvement over naive domain randomization. Project videos and code at https://yuqingd.github.io/autotuned-sim2real/

研究动机与目标

  • 通过减少对领域随机化中的人工工程依赖,解决机器人领域中的模拟到现实迁移差距。
  • 仅使用真实世界视频中的原始RGB观测,实现对仿真系统参数的自动校准,使其匹配真实世界动力学。
  • 在仿真调优过程中,无需真实世界状态或奖励函数知识,即可消除对这些信息的依赖。
  • 通过更紧密地对齐仿真动力学与现实,提升策略在真实世界部署中的泛化能力和成功率。

提出的方法

  • 将模拟到现实的参数调优问题重构为搜索问题,目标是通过迭代调整仿真参数以匹配真实世界值。
  • 提出一种搜索参数模型(SPM),该模型接收观测序列与动作序列以及当前仿真参数,预测参数是否过高、过低或接近真实世界值。
  • 通过在不同参数设置下的仿真轨迹上使用对比学习训练SPM,使其能够学习区分参数过高或过低的情况。
  • 利用SPM的预测结果指导强化学习策略,通过迭代更新将仿真参数逐步调整至真实世界值。
  • 利用仿真器生成大规模、多样化且具有塑形奖励的数据,一旦参数完成自动调优,即可训练出鲁棒的策略。
  • 在模拟到模拟和模拟到现实的迁移设置中应用该方法,仅使用真实世界的RGB视频进行校准,且无需真实世界状态或奖励函数。

实验结果

研究问题

  • RQ1我们能否仅使用真实世界中的原始RGB观测,自动调优仿真系统参数以匹配真实世界动力学?
  • RQ2将参数调优重构为搜索问题(即预测参数是否过高或过低)是否能比基线领域随机化实现更准确、更鲁棒的模拟到现实迁移?
  • RQ3在无法访问真实世界状态或奖励函数的情况下,基于自动调优参数的仿真数据训练出的模型,能在多大程度上泛化到真实世界的机器人控制任务中?
  • RQ4与标准领域随机化相比,该方法在对动力学敏感的任务(如插销入孔或柜门开启)中的表现如何?

主要发现

  • 在Walker和Ball-in-Cup等任务中,该方法在模拟到现实迁移中优于基线领域随机化,成功率持续提升。
  • 在绳索插销入孔任务中,该方法实现了稳定的向孔移动并偶尔成功,而领域随机化基线无法启动正确的运动。
  • 在柜门滑动任务中,该方法能稳定地将盖子滑开,而领域随机化基线则持续过度滑动并失败。
  • 该方法实现相当或更优性能所用的仿真步数不足领域随机化基线的20%。
  • 消融实验表明,该方法在Cheetah等参数易于学习的环境中表现稳健,但在Ball-in-Cup等敏感动力学环境中稳定性较差,表明其对参数可辨识性存在敏感性。
  • 即使真实值初始时超出随机化范围,该方法仍能成功学习系统参数,尽管此类情况下的收敛更具挑战性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。