Skip to main content
QUICK REVIEW

[论文解读] First Order Optimization in Policy Space for Constrained Deep Reinforcement Learning.

Yiming Zhang, Quan Vuong|arXiv (Cornell University)|Feb 16, 2020
Reinforcement Learning in Robotics被引用 6
一句话总结

FOCOPS 是一种一阶优化方法,在深度强化学习中通过在非参数化策略空间中求解约束优化问题,并将解投影回参数化策略空间,以严格遵守成本约束的同时最大化累积奖励。该方法在训练过程中保证约束满足,并在约束型机器人运动控制任务上优于当前最先进方法。

ABSTRACT

In reinforcement learning, an agent attempts to learn high-performing behaviors through interacting with the environment, such behaviors are often quantified in the form of a reward function. However some aspects of behavior, such as ones which are deemed unsafe and are to be avoided, are best captured through constraints. We propose a novel approach called First Order Constrained Optimization in Policy Space (FOCOPS) which maximizes an agent's overall reward while ensuring the agent satisfies a set of cost constraints. Using data generated from the current policy, FOCOPS first finds the optimal update policy by solving a constrained optimization problem in the nonparameterized policy space. FOCOPS then projects the update policy back into the parametric policy space. Our approach provides a guarantee for constraint satisfaction throughout training and is first-order in nature therefore extremely simple to implement. We provide empirical evidence that our algorithm achieves better performance on a set of constrained robotics locomotive tasks compared to current state of the art approaches.

研究动机与目标

  • 解决在深度强化学习中强制执行安全约束的挑战,其中必须避免不安全行为。
  • 开发一种在整个训练过程中保证约束满足的方法。
  • 设计一种简单、一阶优化方法,易于实现且在实践中有效。
  • 与现有最先进方法相比,提升在约束型控制任务上的性能。

提出的方法

  • FOCOPS 利用从当前策略收集的数据,在非参数化策略空间中制定一个约束优化问题。
  • 通过求解该约束问题计算出最优更新策略,确保成本约束得到满足。
  • 该方法将最优更新策略投影回参数化策略空间,以更新神经网络参数。
  • 该方法为一阶,仅依赖梯度信息,因此计算效率高且实现简单。
  • 它采用类似策略梯度的更新方式,但通过约束优化框架显式地整合约束。
  • 该算法通过设计在每个训练步骤都保持约束满足,无需依赖事后修正。

实验结果

研究问题

  • RQ1在策略空间中使用一阶优化方法能否有效强制执行深度强化学习中的安全约束?
  • RQ2在运动控制任务中,FOCOPS 与最先进方法相比在约束满足性和性能方面表现如何?
  • RQ3将最优策略投影回参数化空间是否能同时保持约束合规性和性能提升?
  • RQ4简单的一阶方法能否在约束型强化学习中取得优于更复杂方法的成果?

主要发现

  • FOCOPS 在整个训练过程中保证约束满足,而不同于仅在推理阶段确保约束满足的方法。
  • 与最先进方法相比,该算法在一组约束型机器人运动控制任务上实现了更优性能。
  • 由于其一阶特性及依赖梯度更新,FOCOPS 计算效率高且易于实现。
  • 实验结果表明,FOCOPS 在严格成本约束下仍能保持高样本效率和稳定的学习过程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。