[论文解读] Watch and Match: Supercharging Imitation with Regularized Optimal Transport
该论文提出了一种新型模仿学习算法——正则化最优传输(ROT),通过行为克隆(BC)预训练与基于最优传输(OT)的自适应轨迹匹配奖励相结合,加速策略学习。通过使用动态平衡BC保真度与探索的软Q过滤正则化方法,ROT在模拟环境中实现90%专家性能的收敛速度提升7.8倍,在仅使用一次示范和一小时在线训练的情况下,实现在真实世界机器人操作任务中达到90.1%的成功率。
Imitation learning holds tremendous promise in learning policies efficiently for complex decision making problems. Current state-of-the-art algorithms often use inverse reinforcement learning (IRL), where given a set of expert demonstrations, an agent alternatively infers a reward function and the associated optimal policy. However, such IRL approaches often require substantial online interactions for complex control problems. In this work, we present Regularized Optimal Transport (ROT), a new imitation learning algorithm that builds on recent advances in optimal transport based trajectory-matching. Our key technical insight is that adaptively combining trajectory-matching rewards with behavior cloning can significantly accelerate imitation even with only a few demonstrations. Our experiments on 20 visual control tasks across the DeepMind Control Suite, the OpenAI Robotics Suite, and the Meta-World Benchmark demonstrate an average of 7.8X faster imitation to reach 90% of expert performance compared to prior state-of-the-art methods. On real-world robotic manipulation, with just one demonstration and an hour of online training, ROT achieves an average success rate of 90.1% across 14 tasks.
研究动机与目标
- 解决逆强化学习(IRL)方法在复杂控制任务中因需要大量在线交互而导致的样本效率低下问题。
- 克服由于策略梯度方差高和策略更新带来的分布偏移导致的IRL训练不稳定性问题。
- 通过结合离线行为克隆与在线轨迹匹配奖励,提升模仿学习中的样本效率。
- 开发一种兼容高维视觉观测且需要极少超参数调优的方法。
- 实现在真实世界机器人中使用极少示范与在线轨迹即可实现快速、鲁棒的模仿学习。
提出的方法
- 在专家示范数据上预训练行为克隆(BC)策略,以减少对在线探索的需求。
- 利用最优传输(OT)计算非参数化的、轨迹匹配的奖励,以指导在线策略优化。
- 引入软Q过滤(soft Q-filtering),一种自适应正则化方案,动态平衡BC策略的接近度与探索性。
- 将IRL目标公式化为一种正则化优化问题,惩罚对预训练BC策略的大幅偏离。
- 使用一种软性、学习得到的加权机制实现正则化,随时间自动降低BC的影响,避免手动设定衰减调度。
- 使用基于OT的奖励与软Q过滤正则化,通过离策略强化学习(如DrQ-v2)端到端训练最终策略。
实验结果
研究问题
- RQ1将行为克隆预训练与基于最优传输的奖励相结合,是否能显著加速复杂控制任务中的模仿学习?
- RQ2自适应正则化(软Q过滤)与固定或人工调优的正则化调度相比,在稳定IRL训练方面表现如何?
- RQ3与对抗性IRL或使用人工设计奖励的标准RL相比,基于OT的奖励计算在提升样本效率方面有多大的改进?
- RQ4所提出的方法是否能在仅使用一次示范和极少在线交互的情况下,在真实世界机器人操作中实现高性能?
- RQ5预训练与正则化在模仿学习样本效率中的相对贡献分别是什么?
主要发现
- 在DeepMind Control Suite、OpenAI Robotics Suite和Meta-World Benchmark的20个模拟视觉控制任务中,ROT相较于最先进基线方法,实现90%专家性能的收敛速度提升7.8倍。
- 在真实世界机器人操作任务中,仅使用一次人类示范和一小时在线训练,ROT在14项任务上平均成功率达到90.1%,显著优于行为克隆(36.1%)和对抗性IRL(14.6%)。
- ROT优于标准深度强化学习方法(如DrQ-v2),后者需要显式任务特定的奖励设计,表明结合OT与正则化的模仿学习可达到或超越基于奖励的强化学习性能。
- 消融实验表明,BC预训练与软Q过滤正则化均不可或缺:移除任一均导致性能显著下降。
- 软Q过滤机制相比人工调优的衰减调度更具训练稳定性,并实现无需超参数调优的更快收敛。
- 在该设置下,基于OT的奖励比对抗性IRL更有效,即使结合正则化,也能产生更稳定、更高效的训练过程。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。