Skip to main content
QUICK REVIEW

[论文解读] Simplifying Deep Reinforcement Learning via Self-Supervision

Daochen Zha, Kwei-Herng Lai|arXiv (Cornell University)|Jun 10, 2021
Reinforcement Learning in Robotics参考文献 45被引用 12
一句话总结

该论文提出自监督强化学习(SSRL),一种简单算法,仅通过在自标注的高奖励轨迹上进行监督回归来训练深度强化学习智能体。通过迭代收集最高奖励的轨迹并利用监督学习模仿这些轨迹,SSRL在无需策略梯度或价值网络的情况下实现了稳定且样本高效的策略改进,在多种环境中的训练稳定性和速度上优于或匹配PPO和DQN。

ABSTRACT

Supervised regression to demonstrations has been demonstrated to be a stable way to train deep policy networks. We are motivated to study how we can take full advantage of supervised loss functions for stably training deep reinforcement learning agents. This is a challenging task because it is unclear how the training data could be collected to enable policy improvement. In this work, we propose Self-Supervised Reinforcement Learning (SSRL), a simple algorithm that optimizes policies with purely supervised losses. We demonstrate that, without policy gradient or value estimation, an iterative procedure of ``labeling" data and supervised regression is sufficient to drive stable policy improvement. By selecting and imitating trajectories with high episodic rewards, SSRL is surprisingly competitive to contemporary algorithms with more stable performance and less running time, showing the potential of solving reinforcement learning with supervised learning techniques. The code is available at https://github.com/daochenzha/SSRL

研究动机与目标

  • 为解决深度强化学习中的不稳定性和高方差问题,利用监督学习技术的稳定性。
  • 探究仅使用监督学习损失是否足以在强化学习中实现稳定且有效的策略改进。
  • 解决在缺乏专家数据的情况下识别高质量示范的挑战。
  • 开发一种简单、可扩展且高效的替代方案,以替代复杂的基于策略或价值的深度强化学习算法。

提出的方法

  • SSRL采用迭代的两步过程:(1) 从当前策略中收集轨迹,并根据回合回报选择表现最佳的轨迹;(2) 在这些选定的高奖励轨迹上通过监督回归训练新策略。
  • 该算法将表现最佳的回合视为‘示范’,并通过监督学习模仿它们,不使用价值函数或策略梯度信号。
  • 排名缓存(ranking buffer)用于存储并重用过去的高奖励轨迹,以提升样本效率并稳定学习过程。
  • 该方法以离策略方式运行,允许使用先前策略版本收集的数据来训练新策略。
  • 该方法依赖于一种简单的基于排名的选择机制,以识别并优先处理累积奖励最高的轨迹。
  • 策略网络通过标准监督回归损失(例如均方误差)在选定轨迹的状态-动作对上进行训练。

实验结果

研究问题

  • RQ1是否可以仅通过监督学习方法(无需策略梯度或价值估计)在强化学习中实现稳定且有效的策略改进?
  • RQ2在缺乏专家示范的情况下,如何自动识别并利用高质量示范进行策略训练?
  • RQ3通过自监督迭代优化示范集是否能带来单调的策略改进?
  • RQ4这种自监督方法是否能在样本效率和训练稳定性方面匹配或超越PPO和DQN等成熟的无模型强化学习算法?

主要发现

  • SSRL在训练过程中实现了近乎单调的策略改进,表现出相较于标准深度强化学习算法更优的稳定性。
  • 在Atari Pong等环境中,SSRL的性能与PPO和DQN相当或更优,同时显著减少了运行时间。
  • 该算法在离散控制和连续控制任务中均表现出色,包括高维图像输入,展现出竞争性的样本效率和稳定的训练过程。
  • 在困难的探索型环境中,SSRL结合计数启发式探索可成功抵达目标,而A2C则失败,凸显其在稀疏奖励设置下的鲁棒性。
  • 该方法计算开销轻量,易于实现,几乎无需超参数调优,且无需价值函数估计。
  • 理论分析表明,在确定性MDP上,SSRL可保证策略改进,为其经验成功提供了形式化基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。