Skip to main content
QUICK REVIEW

[论文解读] Distributed Soft Actor-Critic with Multivariate Reward Representation and Knowledge Distillation

D. Akimov|arXiv (Cornell University)|Nov 29, 2019
Reinforcement Learning in Robotics被引用 7
一句话总结

本文针对 NeurIPS 2019 Learn to Move 挑战赛,提出了一种采用多变量奖励表示和知识蒸馏的分布式软演员-critic(SAC)智能体。该方法采用两阶段训练——首先学习一般性移动,然后遵循目标速度场——并通过知识蒸馏将预训练教师智能体的行为迁移至学生智能体,在比赛中获得 1303.727 的平均奖励,位列第3名。

ABSTRACT

In this paper, we describe NeurIPS 2019 Learning to Move - Walk Around challenge physics-based environment and present our solution to this competition which scored 1303.727 mean reward points and took 3rd place. Our method combines recent advances from both continuous- and discrete-action space reinforcement learning, such as Soft Actor-Critic and Recurrent Experience Replay in Distributed Reinforcement Learning. We trained our agent in two stages: to move somewhere at the first stage and to follow the target velocity field at the second stage. We also introduce novel Q-function split technique, which we believe facilitates the task of training an agent, allows critic pretraining and reusing it for solving harder problems, and mitigate reward shaping design efforts.

研究动机与目标

  • 为基于物理的3D人体模型中的复杂运动控制任务开发一种样本高效的强化学习智能体。
  • 解决在最小化努力的同时,高效学习跟随动态目标速度场的挑战。
  • 通过多变量奖励表示与知识蒸馏,提升训练稳定性和数据效率。
  • 实现预训练策略的有效迁移,以解决更复杂的任务,而无需从头开始重新训练。

提出的方法

  • 智能体采用最大熵强化学习的软演员-critic(SAC)算法,以在性能与探索之间取得平衡。
  • 采用两阶段训练流程:首先学习一般性移动,随后学习遵循目标速度场。
  • 多变量奖励表示将目标速度场编码为2D向量场,作为策略和评论家网络的输入。
  • 知识蒸馏将预训练教师智能体(无目标速度场输入)的行为迁移至接收速度场输入的学生智能体。
  • 蒸馏过程最小化学生与教师策略之间的KL散度,以及评论家Q值之间的均方误差。
  • 使用并行智能体与优先经验回放,以加速训练并提升数据效率。

实验结果

研究问题

  • RQ1多变量奖励表示是否能提升在具有复杂目标动力学的连续控制任务中的策略泛化能力?
  • RQ2知识蒸馏在将简单任务的运动策略迁移至更复杂任务方面有多高效?
  • RQ3采用渐进式奖励设计的分阶段训练是否能提升运动控制中的样本效率?
  • RQ4在简单任务上预训练在多大程度上能提升在更困难目标任务上的最终性能?
  • RQ5结合知识蒸馏的离策略算法(如SAC)是否能在复杂、高维控制环境中实现高性能?

主要发现

  • 该智能体取得了1303.727的平均奖励,在NeurIPS 2019 Learn to Move竞赛中位列第3名。
  • 知识蒸馏仅耗时44分钟,且通过KL散度测量,学生策略与教师策略行为近乎一致。
  • 两阶段训练流程实现了有效的探索,并在更难难度等级下实现了快速收敛。
  • 在难度3上训练需额外160小时,以学习在目标速度场中心稳定站立。
  • 该方法展现出鲁棒性与数据效率,成功实现了预训练评论家与策略网络的迁移。
  • 最终智能体成功跟随目标速度场,并同时获得了移动奖励与目标速度奖励。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。