Skip to main content
QUICK REVIEW

[论文解读] Direct Behavior Specification via Constrained Reinforcement Learning

Julien Roy, Roger Girgis|arXiv (Cornell University)|Dec 22, 2021
Advanced Software Engineering Methodologies被引用 4
一句话总结

本文提出使用带拉格朗日方法的约束强化学习(CRL),通过事件频率约束直接指定期望的智能体行为,避免强化学习中典型的试错式奖励工程。该方法在复杂视频游戏类环境中的多种约束下实现了可扩展、稳定的训练,获得可行且高性能的策略,且无需大量超参数调优。

ABSTRACT

The standard formulation of Reinforcement Learning lacks a practical way of specifying what are admissible and forbidden behaviors. Most often, practitioners go about the task of behavior specification by manually engineering the reward function, a counter-intuitive process that requires several iterations and is prone to reward hacking by the agent. In this work, we argue that constrained RL, which has almost exclusively been used for safe RL, also has the potential to significantly reduce the amount of work spent for reward specification in applied RL projects. To this end, we propose to specify behavioral preferences in the CMDP framework and to use Lagrangian methods to automatically weigh each of these behavioral constraints. Specifically, we investigate how CMDPs can be adapted to solve goal-based tasks while adhering to several constraints simultaneously. We evaluate this framework on a set of continuous control tasks relevant to the application of Reinforcement Learning for NPC design in video games.

研究动机与目标

  • 为解决现实世界强化学习应用中奖励工程不切实际的问题,其中手动奖励塑造易出错且需大量超参数调优。
  • 证明约束马尔可夫决策过程(CMDP)可作为指定强化学习中行为偏好的更直观、可扩展的替代方案。
  • 开发一种稳定且可扩展的算法,能够在保持主任务性能的同时,联合满足多个行为约束。
  • 在类似于视频游戏非玩家角色设计的现实、复杂环境中评估该框架,其中行为保真度至关重要。
  • 表明引入引导性约束可帮助避免在多个约束使主任务不可行时出现平凡策略。

提出的方法

  • 将行为偏好表述为指示函数,用于追踪特定事件(如注视标记物、避开熔岩)的发生频率。
  • 在CMDP框架中将这些行为目标作为约束整合,每个约束对事件频率设定阈值。
  • 采用带乘子归一化的拉格朗日松弛方法,以稳定训练并平衡约束执行。
  • 将SAC(软演员评论家)与拉格朗日乘子结合,联合优化主任务奖励与约束惩罚。
  • 引入成功约束作为引导机制,在训练早期引导智能体朝向可行策略发展。
  • 在受控的竞技场环境和具有动态地形与交互物体的复杂开放世界环境中训练智能体。

实验结果

研究问题

  • RQ1能否通过事件频率阈值表达的行为约束,有效塑造智能体行为,而无需奖励工程?
  • RQ2当多个约束同时应用时,CRL的性能与传统奖励工程相比如何?
  • RQ3采用乘子归一化的拉格朗日CRL能否在强制执行大量约束时稳定训练并提升收敛性?
  • RQ4引入引导性成功约束是否有助于智能体摆脱平凡但满足约束的行为,从而实现更好的主任务性能?
  • RQ5所提出的框架能否在类似视频游戏非玩家角色行为的复杂、现实环境中实现可扩展性?

主要发现

  • 奖励工程需要大量超参数搜索:在两个约束下仅有49次实验中的2次获得性能良好且可行的策略,而在三个约束下343次实验中无一成功。
  • 所提出的CRL框架结合拉格朗日乘子与归一化方法,在竞技场环境中即使面对多个约束,也能成功满足所有约束并完成导航任务。
  • 在开放世界环境中,智能体在最多5000万次训练步后成功完成导航任务,同时满足四个行为约束(接触地面、不处于熔岩中、注视标记物、能量水平高于阈值),展示了良好的可扩展性。
  • 引入引导性成功约束显著提升了策略质量,引导智能体朝向可行且高性能的解,避免了平凡的约束满足行为。
  • 该方法在各环境中均实现了稳定训练与一致的约束满足,其可靠性与设计效率均优于奖励工程。
  • 该框架可轻松集成至现有的策略梯度代码库,在游戏AI及其他工业强化学习应用中展现出强大潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。