Skip to main content
QUICK REVIEW

[论文解读] Robust Domain Randomised Reinforcement Learning through Peer-to-Peer Distillation

Chenyang Zhao, Timothy M. Hospedales|arXiv (Cornell University)|Dec 9, 2020
Reinforcement Learning in Robotics参考文献 28被引用 5
一句话总结

本文提出了一种基于对等蒸馏的强化学习方法(P2PDRL),这是一种在线蒸馏框架,其中多个强化学习智能体在不同的随机化环境中本地训练,并通过基于KL散度的相互正则化交换知识。与集中式蒸馏和基线方法相比,P2PDRL在多种领域中实现了更优的鲁棒性和泛化能力,且无需全局策略或额外推理开销。

ABSTRACT

In reinforcement learning, domain randomisation is an increasingly popular technique for learning more general policies that are robust to domain-shifts at deployment. However, naively aggregating information from randomised domains may lead to high variance in gradient estimation and unstable learning process. To address this issue, we present a peer-to-peer online distillation strategy for RL termed P2PDRL, where multiple workers are each assigned to a different environment, and exchange knowledge through mutual regularisation based on Kullback-Leibler divergence. Our experiments on continuous control tasks show that P2PDRL enables robust learning across a wider randomisation distribution than baselines, and more robust generalisation to new environments at testing.

研究动机与目标

  • 解决由于广泛随机化分布导致的领域随机化强化学习中高方差和不稳定性问题。
  • 通过在无集中蒸馏的情况下实现智能体间知识共享,提升对未见环境的零样本泛化能力。
  • 开发一种去中心化、在线的蒸馏机制,通过相互正则化提升策略鲁棒性。
  • 证明对等蒸馏在样本效率和泛化能力方面优于集中式蒸馏和标准PPO。

提出的方法

  • P2PDRL采用K个并行的强化学习智能体,每个智能体在环境动力学或观测参数的不同随机化版本上进行训练。
  • 每个智能体在优化标准PPO损失以提升策略的同时,还优化一种基于预期Kullback–Leibler(KL)散度的对等蒸馏损失,用于比较动作分布。
  • 蒸馏损失促使智能体将其预测与同伴智能体的预测对齐,从而在无全局策略的情况下实现知识迁移。
  • 该方法以在线方式运行,每个智能体仅使用本地经验与相互正则化来更新其策略。
  • 通过消除训练全局策略的需求,该框架避免了集中式蒸馏带来的计算开销。
  • 该方法在连续控制任务上进行了评估,采用固定的训练随机化强度(ε^tr=0.2),并通过在不同测试领域多样性(ε^te)下测试泛化性能。

实验结果

研究问题

  • RQ1对等蒸馏能否提升领域随机化强化学习中的样本效率和训练稳定性?
  • RQ2与集中式蒸馏或标准PPO相比,在线去中心化蒸馏是否能带来对未见环境更好的泛化能力?
  • RQ3P2PDRL的性能如何随训练领域分布多样性的增加而变化?
  • RQ4通过智能体预测之间KL散度的相互正则化,能否增强对领域分布偏移的鲁棒性?

主要发现

  • 在所有五个连续控制任务(Walker、Ant、Humanoid、Hopper、HalfCheetah)中,P2PDRL的渐近性能均优于基线方法PPO和DnC。
  • P2PDRL在样本效率方面优于基线方法,尤其在Ant和HalfCheetah任务中表现更优,训练曲线显示其收敛速度更快。
  • 在不同领域偏移程度(ε^te)下,P2PDRL对新型测试环境的泛化能力显著优于PPO和DnC,转移性能更优。
  • 即使在高训练领域多样性(ε^tr最高达0.5)下,P2PDRL的测试回报仍保持稳定,而PPO的性能在ε^tr超过0.5后迅速下降。
  • P2PDRL无需集中式蒸馏步骤即可保持强大性能,降低了计算成本,同时提升了鲁棒性。
  • 该方法在训练效率和零样本泛化能力方面均表现出一致的改进,尤其在高领域偏移条件下优势明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。