Skip to main content
QUICK REVIEW

[论文解读] Learning Active Task-Oriented Exploration Policies for Bridging the Sim-to-Real Gap

Jacky Liang, Saumya Saxena|arXiv (Cornell University)|Jun 2, 2020
Reinforcement Learning in Robotics参考文献 36被引用 5
一句话总结

本文提出一种学习主动的、面向任务的探索策略,通过显式识别与任务相关的系统参数,以弥合机器人操作中的仿真到现实的差距。与仅优化通用模型精度的探索方法相比,该方法通过优化下游任务性能来实现探索,显著提升了在有限探索预算下的真实世界任务表现,尤其优于无任务特异性的探索方法。

ABSTRACT

Training robotic policies in simulation suffers from the sim-to-real gap, as simulated dynamics can be different from real-world dynamics. Past works tackled this problem through domain randomization and online system-identification. The former is sensitive to the manually-specified training distribution of dynamics parameters and can result in behaviors that are overly conservative. The latter requires learning policies that concurrently perform the task and generate useful trajectories for system identification. In this work, we propose and analyze a framework for learning exploration policies that explicitly perform task-oriented exploration actions to identify task-relevant system parameters. These parameters are then used by model-based trajectory optimization algorithms to perform the task in the real world. We instantiate the framework in simulation with the Linear Quadratic Regulator as well as in the real world with pouring and object dragging tasks. Experiments show that task-oriented exploration helps model-based policies adapt to systems with initially unknown parameters, and it leads to better task performance than task-agnostic exploration.

研究动机与目标

  • 通过减少对领域随机化和无模型微调的依赖,解决机器人策略学习中的仿真到现实差距。
  • 克服无任务特异性的探索方法的局限性,后者将所有系统参数同等对待,在探索预算受限时可能表现不佳。
  • 构建一种框架,其中探索策略被训练以最大化对任务性能最敏感的动力学参数的预测准确性。
  • 实现在不重新训练的情况下,跨多样化系统参数和任务目标的已学习探索策略的泛化能力。
  • 通过在真实世界执行中使用识别出的参数进行基于模型的轨迹优化,弥合仿真与现实之间的差距。

提出的方法

  • 在仿真环境中使用系统参数和任务目标的分布训练探索策略,损失函数根据任务成本敏感度对动力学预测误差进行加权。
  • 采用嵌套采样方法计算探索策略的梯度,结合对系统参数和任务目标的有限差分近似。
  • 在真实世界中应用已学习的探索策略,以收集轨迹用于未知动力学参数(如质量与摩擦)的系统辨识(Sys-Id)。
  • 将识别出的参数输入基于模型的轨迹优化器(如LQR或直接轨迹优化)中,生成用于真实世界执行的任务策略。
  • 设计探索动作对任务关键参数敏感——例如,在拖拽任务中,从距离物体质心更远的位置开始,以探测扭转摩擦。
  • 结合解析模型(如LQR)和完整动力学仿真器(如PyBullet)来实现在仿真与真实世界任务中的框架构建。

实验结果

研究问题

  • RQ1面向任务的探索是否能在识别出提升真实世界任务表现的系统参数方面,优于无任务特异性的探索?
  • RQ2在探索预算受限的情况下,通过优化下游任务成本敏感度来引导探索,是否能提升对未知真实世界动力学的适应能力?
  • RQ3单一已学习的探索策略是否能在不重新训练的情况下,泛化到多样化的系统参数和任务目标?
  • RQ4在系统辨识精度和最终任务成本方面,面向任务的探索与随机或被动探索相比表现如何?
  • RQ5在高维参数空间中,面向任务的探索是否相比无任务特异性的方法,能有效降低探索的维度?

主要发现

  • 在真实世界的箱子拖拽任务中,面向任务的探索显著降低了任务执行成本的均值和标准差,优于无任务特异性和随机探索。
  • 在箱子拖拽任务中,与无任务特异性的策略相比,面向任务的策略将平均成本降低了超过50%,每种方法进行了48次试验,涵盖不同箱子质量与表面材质。
  • 面向任务的探索策略生成的轨迹对扭转摩擦参数更敏感,表现为从距离物体质心更远的位置开始。
  • 在LQR仿真任务中,面向任务的策略在训练期间表现出更低的遗憾比率和更高的参数估计精度,优于无任务特异性的探索。
  • 在倒液任务中,面向任务的策略更有效地识别出与任务相关的水杯质量,从而在真实世界执行中提升了成功率。
  • 该框架在不重新训练的情况下,实现了对不同系统参数和任务目标的泛化,展示了所学探索策略的鲁棒性与可迁移性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。