Skip to main content
QUICK REVIEW

[论文解读] Sim and Real: Better Together

Shirli Di Castro Shashua, Dotan Di Castro|arXiv (Cornell University)|Oct 1, 2021
Simulation Techniques and Applications被引用 5
一句话总结

本文提出了一种新颖的强化学习框架,通过为每种环境维护独立的经验回放缓冲区,并将数据收集速率与优化速率解耦,实现同时使用仿真和真实世界数据训练智能体。该方法通过平衡高吞吐量的仿真与高保真的真实世界反馈,改善了仿真到真实世界的迁移效果,在机器人操作任务中实现了更高的样本效率和性能,相较于标准的仿真到真实基线方法,成功率提升了25%。

ABSTRACT

Simulation is used extensively in autonomous systems, particularly in robotic manipulation. By far, the most common approach is to train a controller in simulation, and then use it as an initial starting point for the real system. We demonstrate how to learn simultaneously from both simulation and interaction with the real environment. We propose an algorithm for balancing the large number of samples from the high throughput but less accurate simulation and the low-throughput, high-fidelity and costly samples from the real environment. We achieve that by maintaining a replay buffer for each environment the agent interacts with. We analyze such multi-environment interaction theoretically, and provide convergence properties, through a novel theoretical replay buffer analysis. We demonstrate the efficacy of our method on a sim-to-real environment.

研究动机与目标

  • 通过支持在仿真和真实世界数据上联合训练,解决仿真到真实世界强化学习中的现实差距问题。
  • 克服高吞吐量仿真与低吞吐量、高保真真实世界数据收集之间的不平衡问题。
  • 开发一种将数据收集速率与优化速率解耦的方法,以提升样本效率和策略收敛性。
  • 对多环境经验回放缓冲区动力学进行理论分析,包括马尔可夫性与诱导概率测度。
  • 在仿真与真实环境之间存在实际摩擦差异的机器人操作任务上,对方法进行实证验证。

提出的方法

  • 智能体与 K 个环境(例如仿真和真实)交互,并为每个环境单独存储转换数据到经验回放缓冲区。
  • 一种采样机制以概率 βj 从每个经验回放缓冲区中选择转换,该概率与数据收集速率 qi 无关。
  • 该方法使用异策略算法(线性演员-critic 和 DDPG 变体)利用混合经验回放缓冲区样本优化策略。
  • 应用重要性采样原理,以纠正仿真与真实数据之间的分布偏移。
  • 独立的经验回放缓冲区可防止在优化过程中因高容量、低保真的仿真数据导致的性能退化。
  • 理论分析证明了在所提出的多环境经验回放设置下,算法的渐近收敛性。

实验结果

研究问题

  • RQ1与标准的仿真到真实迁移方法相比,联合学习仿真和真实世界数据是否能提升策略性能?
  • RQ2在训练过程中,如何有效管理高吞吐量仿真与低吞吐量真实世界数据之间的不平衡?
  • RQ3在使用独立经验回放缓冲区的多个不同环境中训练的强化学习智能体,其理论收敛行为如何?
  • RQ4将数据收集与优化速率解耦是否能提升仿真到真实设置下的样本效率和策略泛化能力?
  • RQ5真实世界数据在多大程度上可以纠正仿真中的不准确性,例如错误的摩擦参数?

主要发现

  • 在相同训练条件下,所提方法在真实环境中的成功率比标准的仿真到真实微调方法高出25%。
  • 为仿真和真实数据分别使用独立经验回放缓冲区,显著优于共享经验回放缓冲区,后者因数据不平衡导致性能下降。
  • 理论分析证实了在多环境经验回放设置下,所提算法的渐近收敛性,且明确刻画了诱导概率测度与马尔可夫性质。
  • 该方法对仿真不准确性表现出鲁棒性,特别是在摩擦参数方面:真实环境成功纠正了仿真中 2.0–2.2 摩擦范围的错误,否则将导致失败。
  • 将数据收集与优化速率解耦,使得真实世界数据得以有效利用,而无需进行过多的真实世界轨迹采样。
  • 实证结果表明,即使仿真中的数据收集速率高出100倍,该方法仍通过在优化过程中优先使用高保真真实数据,实现了更优的真实世界性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。