[论文解读] Rethinking Sim2Real: Lower Fidelity Simulation Leads to Higher Sim2Real Transfer in Navigation
本文挑战了高保真度仿真能提升四足机器人导航中模拟到现实(sim2real)迁移性能的假设。通过在低保真度运动学仿真中注入从真实机器人采集的逼真执行器噪声,该方法在真实世界中的表现优于在高保真度动力学仿真器中训练的模型,表明通过精确建模噪声的低保真度仿真反而能实现更优的 sim2real 泛化性能。
If we want to train robots in simulation before deploying them in reality, it seems natural and almost self-evident to presume that reducing the sim2real gap involves creating simulators of increasing fidelity (since reality is what it is). We challenge this assumption and present a contrary hypothesis -- sim2real transfer of robots may be improved with lower (not higher) fidelity simulation. We conduct a systematic large-scale evaluation of this hypothesis on the problem of visual navigation -- in the real world, and on 2 different simulators (Habitat and iGibson) using 3 different robots (A1, AlienGo, Spot). Our results show that, contrary to expectation, adding fidelity does not help with learning; performance is poor due to slow simulation speed (preventing large-scale learning) and overfitting to inaccuracies in simulation physics. Instead, building simple models of the robot motion using real-world data can improve learning and generalization.
研究动机与目标
- 探究更高保真度仿真是否能提升四足机器人导航中的 sim2real 迁移性能。
- 通过从真实机器人建模逼真的执行器噪声,弥合仿真与真实世界性能之间的差距。
- 评估在噪声注入下训练的运动学策略是否比在高保真度仿真器中训练的动力学策略泛化能力更强。
- 通过测量训练仿真器与评估仿真器之间的性能差距,量化动力学仿真中的过拟合程度。
- 证明通过简化仿真保真度并增强噪声建模的真实性,可以改善 sim2real 迁移性能。
提出的方法
- 在空旷房间中,使用解耦和耦合的速率指令,从 Boston Dynamics Spot 机器人采集真实世界执行器噪声。
- 对采集的噪声数据拟合二元正态分布,以建模前后、侧向及角速度的不确定性。
- 在训练期间,通过在策略预测速度上叠加采样噪声,将噪声注入运动学仿真中。
- 使用近端策略优化(PPO)训练高层导航策略,采用广义优势估计(GAE),折扣因子为 0.99,GAE 参数为 0.95。
- 设计的奖励函数包括:形状化的测地线距离、碰撞惩罚(-0.03)、跌倒惩罚(-5.0)、成功奖励(10.0)、松弛惩罚(-0.002)以及后退运动惩罚(-0.03)。
- 在 sim2sim 和运动学至动力学迁移设置下,使用两种低层控制器(Raibert 和 MPC)评估策略,性能通过保留场景上的成功率衡量。
实验结果
研究问题
- RQ1在低保真度运动学仿真中使用逼真执行器噪声进行训练,是否能比在高保真度动力学仿真中训练获得更好的 sim2real 迁移性能?
- RQ2执行器噪声建模如何影响策略在不同仿真器和控制器之间的泛化能力?
- RQ3动力学策略在多大程度上会过拟合到其训练所用的特定仿真器和控制器?
- RQ4与带有噪声注入的运动学策略相比,动力学策略在训练与评估仿真器之间的性能差距是否更大?
- RQ5执行器噪声的耦合建模(所有方向同时指令)是否比解耦噪声建模带来更好的真实世界性能?
主要发现
- 在 iGibson 中使用 Raibert 控制器时,注入执行器噪声的运动学策略在 Aliengo 上实现了 68.9% 的成功率,优于在动态仿真中训练的策略(45.4%),即使在动态控制下评估也是如此。
- 对于动力学策略,训练(Habitat-Dynamic)与评估(iGibson-Dynamic)仿真器之间的性能差距随训练步数增加而扩大,表明存在过拟合现象——例如,A1 在 5000 万步后差距达 27.2%。
- 耦合噪声模型(σₓ=0.054 m/s,σᵧ=0.065 m/s,σω=2.599 deg/s)在真实世界迁移中优于解耦模型(σₓ=0.036 m/s,σᵧ=0.044 m/s,σω=1.468 deg/s),尽管两者均优于无噪声建模。
- 真实世界执行器噪声具有非对称性和非全向性:前后方向标准差为 0.097 m,侧向为 0.139 m,这解释了为何将速度饱和值设为 0.5 m/s。
- 即使使用 Boston Dynamics 的 Raibert 控制器等高度调优的控制器,四足机器人仍表现出显著的跟踪误差,这促使在仿真中引入噪声建模。
- 在所有机器人(A1、Aliengo、Spot)上,注入噪声训练的运动学策略成功率始终高于动力学策略,证实了低保真度仿真结合逼真噪声建模可实现更优的 sim2real 迁移性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。