Skip to main content
QUICK REVIEW

[论文解读] Benchmarking Structured Policies and Policy Optimization for Real-World Dexterous Object Manipulation

Niklas Funk, Charles Schaff|arXiv (Cornell University)|May 5, 2021
Robot Manipulation and Learning参考文献 53被引用 23
一句话总结

本文针对基于TriFinger机器人平台的真实世界灵巧操作任务,对结构化策略与优化技术进行了基准测试。提出了一种运动规划方法、柔顺阻抗控制方法以及残差策略学习方法,结果表明贝叶斯优化显著提升了超参数调优性能,而残差策略则增强了鲁棒性,尤其在运动规划方面表现突出,且实现了无需领域随机化的成功仿真到现实世界迁移。

ABSTRACT

Dexterous manipulation is a challenging and important problem in robotics. While data-driven methods are a promising approach, current benchmarks require simulation or extensive engineering support due to the sample inefficiency of popular methods. We present benchmarks for the TriFinger system, an open-source robotic platform for dexterous manipulation and the focus of the 2020 Real Robot Challenge. The benchmarked methods, which were successful in the challenge, can be generally described as structured policies, as they combine elements of classical robotics and modern policy optimization. This inclusion of inductive biases facilitates sample efficiency, interpretability, reliability and high performance. The key aspects of this benchmarking is validation of the baselines across both simulation and the real system, thorough ablation study over the core features of each solution, and a retrospective analysis of the challenge as a manipulation benchmark. The code and demo videos for this work can be found on our website (https://sites.google.com/view/benchmark-rrc).

研究动机与目标

  • 建立一个基于开源TriFinger平台的真实世界灵巧操作可复现基准测试。
  • 评估结合经典机器人学与现代强化学习的结构化策略,以提升样本效率与可靠性。
  • 研究在真实环境中通过贝叶斯优化进行超参数优化以及残差策略学习的有效性。
  • 分析所学策略在仿真到现实世界迁移中的表现,并识别实现鲁棒现实部署的关键组件。
  • 对2020年真实机器人挑战赛进行回顾性分析,以指导未来灵巧操作基准测试与竞赛设计。

提出的方法

  • 开发了三种结构化控制策略:运动规划(MP)、柔顺阻抗控制(CIC)以及基于力矩指令的任务特定抓取策略(CPC)。
  • 应用贝叶斯优化(BO)对每种控制器的超参数进行调优,利用高斯过程模型指导目标函数的搜索。
  • 通过强化学习学习校正动作,将残差策略学习(RPL)集成到基础控制器中以实现精细化调整。
  • 在仿真环境和真实的TriFinger机器人上开展了广泛的消融实验,评估多种任务变体与目标分布下的性能表现。
  • 采用标准化评估协议,评估指标包括稀疏密集奖励、最终位置误差以及每种条件下的20次轨迹中的掉落率。
  • 在未使用领域随机化或微调的情况下,评估从仿真到真实硬件的迁移性能,重点考察鲁棒性与泛化能力。

实验结果

研究问题

  • RQ1结合经典控制与学习组件的结构化策略在真实世界灵巧操作任务中,其精度、可靠性与样本效率表现如何?
  • RQ2贝叶斯优化在不同策略结构中通过调优超参数,能在多大程度上提升控制器性能?
  • RQ3残差策略学习是否能增强真实环境中基础控制器的鲁棒性?是否能在无需领域随机化的情况下实现成功的仿真到现实世界迁移?
  • RQ4仿真与真实世界部署之间的性能特征有何差异?导致仿真到现实世界差距的关键因素是什么?
  • RQ5从2020年真实机器人挑战赛中可获得哪些启示,以指导未来灵巧操作基准测试与竞赛规程的设计?

主要发现

  • 在L3任务中,贝叶斯优化显著提升了所有控制器的性能,无论在仿真还是真实世界评估中,均提高了平均稀疏密集奖励并降低了位置误差。
  • 对于MP-PG控制器,残差策略学习将真实系统上的掉落率从40.0%降低至1.74%,并提升了抓取稳定性,有效防止了灾难性失败。
  • CPC-TG控制器在仿真中获得了最高奖励(−70.0 ± 9.42)与低掉落率(0.25 ± 0.15),但MP-PG控制器因在真实世界执行中表现更可靠而赢得比赛。
  • 出人意料的是,残差策略可直接从仿真迁移到真实硬件,无需微调或领域随机化,表明其具备强大的泛化能力。
  • CIC-CG控制器在贝叶斯优化后性能得到提升,在仿真中实现了平均奖励−570 ± 350.6与掉落率3.52 ± 3.91,且在真实世界中性能下降极小。
  • 即使未提供手动超参数先验,贝叶斯优化仍能优化出与人工调优相当或更优的参数,充分证明其在真实世界控制优化中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。