[论文解读] BeBold: Exploration Beyond the Boundary of Explored Regions
BeBold 提出了一种新颖的内在奖励(IR)机制,利用轨迹中连续状态间逆访问频次的受控差异,驱动智能体在已探索区域之外进行探索,从而缓解基于计数方法中的短视性与脱离问题。该方法在无需课程学习的情况下,仅用1.2亿次环境交互步数即解决了全部12个最具挑战性的程序化生成MiniGrid任务,性能超越先前的最先进方法。
Efficient exploration under sparse rewards remains a key challenge in deep reinforcement learning. To guide exploration, previous work makes extensive use of intrinsic reward (IR). There are many heuristics for IR, including visitation counts, curiosity, and state-difference. In this paper, we analyze the pros and cons of each method and propose the regulated difference of inverse visitation counts as a simple but effective criterion for IR. The criterion helps the agent explore Beyond the Boundary of explored regions and mitigates common issues in count-based methods, such as short-sightedness and detachment. The resulting method, BeBold, solves the 12 most challenging procedurally-generated tasks in MiniGrid with just 120M environment steps, without any curriculum learning. In comparison, the previous SoTA only solves 50% of the tasks. BeBold also achieves SoTA on multiple tasks in NetHack, a popular rogue-like game that contains more challenging procedurally-generated environments.
研究动机与目标
- 解决深度强化学习中稀疏奖励下的高效探索问题。
- 克服现有内在奖励方法的局限性,如短视性、脱离问题,以及基于状态差异方法的渐近不一致性。
- 开发一种简单而有效的探索准则,鼓励智能体突破已探索区域的边界。
- 在无需课程学习或复杂课程设计的前提下,实现在MiniGrid和NetHack等复杂程序化环境中的最先进性能。
提出的方法
- 提出一种基于轨迹中连续状态间逆访问频次受控差异的新型内在奖励机制。
- 使用随机网络蒸馏(RND)近似逆访问频次,实现高效且可扩展的估计。
- 将内在奖励定义为 max(1/N(s_{t+1}) - 1/N(s_t), 0),其中 N(s) 为状态 s 的访问频次,确保在探索前沿获得高奖励。
- 引入“受控”差异以防止随机环境动态导致的虚假奖励,提升稳定性。
- 采用哈希表维护回合内访问频次,实现高效的在线策略跟踪。
- 在标准深度强化学习框架中应用该方法,跨环境共享架构与超参数。
实验结果
研究问题
- RQ1一种简单、基于计数的内在奖励机制能否有效驱动智能体突破已探索区域的边界?
- RQ2与现有IR方法相比,逆访问频次的受控差异在缓解短视性与脱离问题方面表现如何?
- RQ3该方法能否在无需课程学习的情况下,实现在MiniGrid和NetHack等复杂程序化环境中的最先进性能?
- RQ4该方法在随机环境中的泛化能力如何,特别是在高熵或噪声动力学的环境中?
主要发现
- BeBold 在1.2亿次环境交互步内解决了全部12个最具挑战性的程序化生成MiniGrid任务,成功率达到100%,而先前最先进方法仅能解决较简单任务中的50%。
- 在MonteZuma’s Revenge任务中,BeBold优于RND与RIDE,使用RNN模型时获得约13,000的外在回报,超过RND的4,400。
- BeBold显著缓解了基于计数方法中常见的脱离问题,且无需像Go-Explore那样采用复杂的多阶段训练。
- 在NetHack环境中,BeBold在多个任务上均达到最先进性能,展现出在高度复杂、程序化生成环境中的强大泛化能力。
- 该内在奖励机制具有渐近一致性,因为随着探索充分进行,逆访问频次趋于零,避免了基于状态差异方法中持续存在的奖励问题。
- 尽管结构简单,BeBold仍优于更复杂的模型(如Go-Explore与RIDE),尤其在需要长时程探索与边界穿越的环境中表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。