[论文解读] Mutual Alignment Transfer Learning
本文提出互对齐迁移学习(MATL),一种通过联合训练仿真环境与真实机器人智能体,并利用对抗性辅助奖励对齐其状态访问分布,从而加速真实机器人强化学习的方法。该方法在稀疏奖励与高差异性场景中提升了样本效率,优于直接迁移与微调,尤其在仿真策略过拟合或动力学差异显著时表现更优。
Training robots for operation in the real world is a complex, time consuming and potentially expensive task. Despite significant success of reinforcement learning in games and simulations, research in real robot applications has not been able to match similar progress. While sample complexity can be reduced by training policies in simulation, such policies can perform sub-optimally on the real platform given imperfect calibration of model dynamics. We present an approach -- supplemental to fine tuning on the real robot -- to further benefit from parallel access to a simulator during training and reduce sample requirements on the real robot. The developed approach harnesses auxiliary rewards to guide the exploration for the real world agent based on the proficiency of the agent in simulation and vice versa. In this context, we demonstrate empirically that the reciprocal alignment for both agents provides further benefit as the agent in simulation can adjust to optimize its behaviour for states commonly visited by the real-world agent.
研究动机与目标
- 解决由于真实世界交互缓慢且昂贵,导致训练真实世界机器人策略时样本复杂度过高的挑战。
- 克服当仿真与真实世界动力学显著不同时,直接策略迁移与微调方法的局限性。
- 在稀疏奖励环境中提升样本效率,此时标准强化学习难以有效探索。
- 实现不同仿真引擎之间稳定且有效的迁移,即使动力学差异未知。
- 开发一种方法,通过状态分布的相互对齐,使仿真与真实世界智能体相互受益。
提出的方法
- 并行训练仿真与真实世界智能体,同时优化环境奖励与辅助对齐奖励。
- 使用对抗性判别器区分来自真实机器人与仿真器的状态序列,促使两个智能体生成难以区分的状态轨迹。
- 采用基于Wasserstein GAN(WGAN)的混淆损失构造辅助奖励,以稳定训练并提升对齐效果。
- 通过可学习的权重超参数λ将辅助对齐奖励整合进策略优化目标。
- 允许仿真策略通过访问对真实智能体有益的状态来引导真实世界探索,同时真实智能体的行为也提升了仿真策略的鲁棒性。
- 将该方法作为微调的补充,实现更好的初始化并加速真实机器人上的收敛。
实验结果
研究问题
- RQ1在仿真与真实世界智能体之间实现对抗性状态分布对齐,是否能提升真实机器人强化学习中的样本效率?
- RQ2在高动力学差异场景中,双方相互对齐(即双方引导彼此探索)是否优于单向对齐或直接迁移?
- RQ3当环境奖励稀疏或无信息时,该方法是否仍能成功,从而避免标准强化学习因无法有效探索而失效?
- RQ4在存在未知动力学差异的不同仿真引擎之间迁移时,MATL的表现如何?
- RQ5MATL是否能缓解仿真策略过拟合带来的负面影响,从而改善真实机器人上微调性能的下降?
主要发现
- MATL在稀疏或无信息奖励环境中显著加速了真实机器人上的训练,而标准强化学习在此类环境中难以有效探索。
- 在不同仿真引擎之间迁移(如MuJoCo到DART)时,MATL优于直接迁移与微调,即使微调表现甚至劣于随机初始化,原因在于仿真策略过拟合。
- 互对齐在所有运动任务中均持续提升性能,MATL的最终性能优于单向对齐(MATLu)与独立训练。
- 该方法对显著的动力学差异具有鲁棒性,包括摩擦、阻尼与接触建模的差异,而直接迁移在此类情况下完全失效。
- 辅助对齐奖励即使在真实世界智能体无环境奖励时,也能实现有效探索。
- 基于对抗性WGAN的损失公式稳定了训练过程,并带来比原始GAN损失更优的对齐效果,后者未能提升性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。