Skip to main content
QUICK REVIEW

[论文解读] I'm sorry Dave, I'm afraid I can't do that, Deep Q-learning from forbidden action

Mathieu Seurin, Pierre‐Marie Preux|arXiv (Cornell University)|Oct 4, 2019
Reinforcement Learning in Robotics参考文献 48被引用 7
一句话总结

本文提出了一种改进的深度Q网络(DQN),通过引入一种前沿损失(frontier loss),使模型能够从被安全约束拒绝的无效动作中学习——即现实环境中被禁止的动作。该方法将无效动作的Q值推低至有效动作之下,从而加速收敛并减少不安全动作的调用,使在约束环境中的强化学习更加安全和高效。

ABSTRACT

The use of Reinforcement Learning (RL) is still restricted to simulation or to enhance human-operated systems through recommendations. Real-world environments (e.g. industrial robots or power grids) are generally designed with safety constraints in mind implemented in the shape of valid actions masks or contingency controllers. For example, the range of motion and the angles of the motors of a robot can be limited to physical boundaries. Violating constraints thus results in rejected actions or entering in a safe mode driven by an external controller, making RL agents incapable of learning from their mistakes. In this paper, we propose a simple modification of a state-of-the-art deep RL algorithm (DQN), enabling learning from forbidden actions. To do so, the standard Q-learning update is enhanced with an extra safety loss inspired by structured classification. We empirically show that it reduces the number of hit constraints during the learning phase and accelerates convergence to near-optimal policies compared to using standard DQN. Experiments are done on a Visual Grid World Environment and Text-World domain.

研究动机与目标

  • 解决在安全约束会拒绝危险动作的环境中进行强化学习的挑战。
  • 克服标准DQN的局限性,即把被拒绝的动作视为无操作(no-ops),从而无法从中学习。
  • 设计一种方法,利用外部控制器或动作掩码提供的反馈,以改善探索和策略学习。
  • 在现实应用中加速收敛至近似最优策略,同时最小化不安全动作的使用。

提出的方法

  • 在标准DQN中引入受结构分类启发的前沿损失,以分离被禁止动作与有效动作的Q值。
  • 训练一个分类头,预测动作是否被禁止,使用基于间隔的损失来强制Q值之间形成安全差距。
  • 将前沿损失整合到DQN更新规则中,通过引入安全感知正则化修改时间差分目标。
  • 采用双头网络结构:一个用于Q值预测,一个用于动作有效性分类,两者联合训练。
  • 在具有动作掩码的环境中应用该方法(例如,视觉网格世界、TextWorld),其中超出物理或语法边界的动作会被拒绝。
  • 确保模型学会认识到被禁止的动作不仅无效,而且本质上次优,从而引导探索朝向更安全的策略。

实验结果

研究问题

  • RQ1标准DQN能否有效从被外部安全控制器过滤的被拒绝动作中学习?
  • RQ2添加前沿损失如何提升在具有被禁止动作环境中的学习效率和安全性?
  • RQ3与标准DQN相比,所提出的方法是否减少了训练过程中对被禁止动作的调用次数?
  • RQ4即使智能体最初探索了危险动作,前沿损失是否仍能引导探索朝向更安全的策略?
  • RQ5该方法在具有大规模或可变动作空间的环境中具有多大程度的泛化能力?

主要发现

  • 所提出的带前沿损失的DQN在训练过程中显著减少了对被禁止动作的调用次数,相比标准DQN。
  • 该方法加速了收敛至近似最优策略,视觉网格世界和TextWorld环境中的性能提升均更迅速。
  • 即使在100,000次训练步骤后,标准DQN仍无法清晰分离被禁止动作与有效动作的Q值,而前沿损失始终保持稳定的差距。
  • 可视化结果表明,前沿损失在训练初期即重塑Q值分布,引导智能体避开危险动作。
  • 该方法通过让智能体认识到某些动作不仅无效,而且具有危害性,从而改善了探索,提升了策略泛化能力。
  • 前沿损失使在大规模或可变动作空间环境中实现有效学习成为可能,尤其适用于动作拒绝频繁发生的场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。