[论文解读] Modelling Generalized Forces with Reinforcement Learning for Sim-to-Real Transfer
本文提出了一种基于强化学习的方法,用于在仿真中建模状态相关的广义力,以提升机器人操作的仿真到现实的迁移性能。通过仅使用几分钟的真实世界数据学习表达性强、符合物理规律的力修正,该方法在三维位置匹配任务中实现了84%的成功率,显著优于基线模型,并在复杂的6D位姿任务中表现出稳健的迁移能力。
Learning robotic control policies in the real world gives rise to challenges in data efficiency, safety, and controlling the initial condition of the system. On the other hand, simulations are a useful alternative as they provide an abundant source of data without the restrictions of the real world. Unfortunately, simulations often fail to accurately model complex real-world phenomena. Traditional system identification techniques are limited in expressiveness by the analytical model parameters, and usually are not sufficient to capture such phenomena. In this paper we propose a general framework for improving the analytical model by optimizing state dependent generalized forces. State dependent generalized forces are expressive enough to model constraints in the equations of motion, while maintaining a clear physical meaning and intuition. We use reinforcement learning to efficiently optimize the mapping from states to generalized forces over a discounted infinite horizon. We show that using only minutes of real world data improves the sim-to-real control policy transfer. We demonstrate the feasibility of our approach by validating it on a nonprehensile manipulation task on the Sawyer robot.
研究动机与目标
- 通过使用真实世界数据提升仿真保真度,以解决机器人操作中的仿真到现实差距。
- 建模分析模型无法捕捉的复杂、与状态相关的约束力。
- 仅使用几分钟的真实世界数据,实现高效的仿真到现实迁移。
- 开发一种在保持物理可解释性的同时实现高表达力的力建模方法。
- 在非抓取操作任务(如3D和6D位姿匹配)上展示改进的策略迁移性能。
提出的方法
- 该方法引入了加法形式的、与状态相关的广义力(GFM),以校正仿真与真实世界动力学之间的差异。
- 广义力通过神经网络作为函数逼近器进行建模,并在折扣无限时域上通过强化学习进行训练。
- 强化学习目标优化广义力策略,以最小化仿真与真实世界状态转移之间的差异。
- 采用结合分析动力学与学习到的广义力的混合模型对方法进行验证。
- 应用课程学习策略以稳定训练并提高样本效率。
- 该方法通过修改环境动力学而非代理动作,对广义动作变换(Ground Action Transformation)进行了泛化。
实验结果
研究问题
- RQ1能否从极少的真实世界数据中有效学习到与状态相关的广义力,以提升仿真到现实的迁移性能?
- RQ2与领域随机化或课程学习相比,学习广义力在仿真到现实性能上的表现如何?
- RQ3所提出的方法能否在不同操作任务(包括6D位姿匹配)上实现泛化?
- RQ4为平衡数据利用与策略性能,广义力模型的最优数量是多少?
- RQ5该方法在实现复杂动力学高表达力建模的同时,是否仍保持物理可解释性?
主要发现
- 所提方法在3D位置匹配任务中实现了84%的成功率,显著优于原始模型(38%)和其他基线模型。
- 使用三个广义力模型的集成取得了最佳性能,而五个模型则因过拟合和任务复杂度增加导致性能下降。
- 在更具挑战性的6D位姿匹配任务中,包含三个GFMs的混合模型将迁移性能从18%提升至44%。
- 结果表明,即使仅使用几分钟的真实世界数据,也能显著提升仿真到现实的迁移性能。
- 该方法优于课程学习和随机扰动基线,表明学习到的广义力在性能上优于启发式数据增强方法。
- 结果表明,合理平衡广义力模型的数量对避免过拟合并维持最优策略性能至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。