Skip to main content
QUICK REVIEW

[论文解读] Deep Abstract Q-Networks

Melrose Roderick, Christopher Grimm|arXiv (Cornell University)|Oct 2, 2017
Reinforcement Learning in Robotics参考文献 14被引用 7
一句话总结

本文提出深度抽象Q网络(DAQN),一种分层强化学习方法,结合深度Q网络与专家提供的状态抽象,以解决Montezuma’s Revenge和Venture等长时程、稀疏奖励环境中的问题。通过使用符号化的高层状态抽象(如房间和钥匙持有状态)与基于像素的低层表征,DAQN实现了有效的长期规划与回溯行为,在挑战性Atari 2600游戏中显著优于DQN和内在动机方法。

ABSTRACT

We examine the problem of learning and planning on high-dimensional domains with long horizons and sparse rewards. Recent approaches have shown great successes in many Atari 2600 domains. However, domains with long horizons and sparse rewards, such as Montezuma's Revenge and Venture, remain challenging for existing methods. Methods using abstraction (Dietterich 2000; Sutton, Precup, and Singh 1999) have shown to be useful in tackling long-horizon problems. We combine recent techniques of deep reinforcement learning with existing model-based approaches using an expert-provided state abstraction. We construct toy domains that elucidate the problem of long horizons, sparse rewards and high-dimensional inputs, and show that our algorithm significantly outperforms previous methods on these domains. Our abstraction-based approach outperforms Deep Q-Networks (Mnih et al. 2015) on Montezuma's Revenge and Venture, and exhibits backtracking behavior that is absent from previous methods.

研究动机与目标

  • 解决在Montezuma’s Revenge和Venture等高维环境中的长时程、稀疏奖励强化学习挑战。
  • 通过将基于模型的抽象与深度强化学习相结合,克服现有方法的局限性,特别是无法执行回溯和长期规划的问题。
  • 通过轻量级、专家提供的状态抽象,将状态空间分解为有意义的属性,使智能体能够学习到稳健且可重用的高层策略。
  • 证明与端到端深度强化学习或内在动机方法相比,结合深度学习的分层抽象可提升探索效率与长期规划效率。

提出的方法

  • 使用专家提供的状态抽象来定义符号化的高层状态(如当前房间、钥匙持有状态),并将完整观测空间映射到这些抽象状态。
  • 应用抽象马尔可夫决策过程(AMDP)形式化,将学习过程分解为高层的表格型MDP(用于长期规划)与低层的深度Q网络(用于像素级控制)。
  • 通过谓词函数将高层状态分解为因子化属性(如房间、区域、物品收集状态),避免动作空间的组合爆炸。
  • 训练一个分层智能体,其中高层策略选择抽象动作(如“前往房间3”),低层策略使用DQN执行相应的视觉导航。
  • 采用两级学习机制:L1智能体(高层)通过表格型Q学习学习长期策略,L0智能体(低层)通过深度Q学习学习状态-动作值。
  • 允许高层智能体在抽象状态上进行规划,同时低层智能体处理详细的视觉控制,从而支持回溯与长时程执行。

实验结果

研究问题

  • RQ1在Montezuma’s Revenge和Venture等长时程、稀疏奖励环境中,具有专家提供抽象的分层强化学习框架是否能优于标准深度Q网络?
  • RQ2将基于模型的抽象与深度学习相结合,是否能实现回溯行为——这对长期规划至关重要,而以往的深度强化学习方法却无法实现?
  • RQ3与基于内在动机的智能体(如IM)相比,所提方法在稀疏奖励与高维观测环境中表现如何?
  • RQ4轻量级、因子化状态抽象在多大程度上降低了长时程规划的复杂性,同时保持学习效率?

主要发现

  • DAQN在Montezuma’s Revenge和Venture上显著优于深度Q网络(DQN),实现了更高的累积奖励,并在多次训练运行中表现出更一致的性能。
  • DAQN智能体成功学习并执行了回溯行为——这是解决多房间导航任务的关键——而DQN和内在动机(IM)智能体均未能实现此行为。
  • 在Montezuma’s Revenge的一条命设置下,IM智能体无法学习回溯,因其伪计数模型将位置与钥匙持有状态视为独立变量,从而抑制了对高计数状态的再次访问。
  • 在Venture环境中,DAQN的评估性能优于DQN和IM基线模型,证明了其在四个房间和走廊结构中实现有效长期规划的能力。
  • 在约3000万帧处观察到性能下降,原因是探索过程中利用子策略出现灾难性遗忘,但经过完整探索后得以恢复。
  • 该方法的成功归因于高层规划(表格型)与低层控制(深度)的分离,实现了长时程策略的稳定学习,且对抽象的人工设计需求极低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。