[论文解读] Principled Exploration via Optimistic Bootstrapping and Backward Induction
本文提出 OB2I,一种结合乐观自助采样(optimistic bootstrapping)与反向归纳(backward induction)的深度强化学习探索方法,以提升样本效率。通过使用非参数自助采样估计认知不确定性(epistemic uncertainty)并沿轨迹反向传播不确定性,OB2I 在深度强化学习中实现了可证明高效的探索,在 MNIST Maze 和 49 个 Atari 游戏上均优于当前最先进方法。
One principled approach for provably efficient exploration is incorporating the upper confidence bound (UCB) into the value function as a bonus. However, UCB is specified to deal with linear and tabular settings and is incompatible with Deep Reinforcement Learning (DRL). In this paper, we propose a principled exploration method for DRL through Optimistic Bootstrapping and Backward Induction (OB2I). OB2I constructs a general-purpose UCB-bonus through non-parametric bootstrap in DRL. The UCB-bonus estimates the epistemic uncertainty of state-action pairs for optimistic exploration. We build theoretical connections between the proposed UCB-bonus and the LSVI-UCB in a linear setting. We propagate future uncertainty in a time-consistent manner through episodic backward update, which exploits the theoretical advantage and empirically improves the sample-efficiency. Our experiments in the MNIST maze and Atari suite suggest that OB2I outperforms several state-of-the-art exploration approaches.
研究动机与目标
- 开发一种适用于深度强化学习的系统性探索方法,保持来自表格型和线性 MDP 的理论保证。
- 通过从自助采样 Q 函数导出的一般性 UCB 奖励,将 LSVI-UCB 算法推广至深度强化学习。
- 通过时间一致的方式沿轨迹反向传播不确定性,提升样本效率。
- 弥合理论驱动的探索方法(如 UCB、后验抽样)与实际深度强化学习应用之间的差距。
- 通过实证验证,基于自助采样 Q 值差异的不确定性探索可显著提升多样化环境中的性能。
提出的方法
- OB2I 使用非参数自助采样训练多个 Q 网络,通过其预测结果的方差估计认知不确定性。
- 构建一般性 UCB 奖励,作为自助采样 Q 值的置信上限,以促进乐观探索。
- 通过反向归纳将未来不确定性估计传播至轨迹中的早期时间步,确保不确定性传播的时间一致性。
- 理论上证明 UCB 奖励与线性 MDP 中的 LSVI-UCB 奖励等价,确保与可证明高效的探索方法一致。
- 结合乐观 Q 值估计与时序扩展的探索,避免先前方法中依赖单步不确定性的假设。
- 算法使用反向更新机制优化价值估计,提升稳定性和样本效率。
实验结果
研究问题
- RQ1能否从深度 Q 网络中导出的自助采样 UCB 奖励,在深度强化学习中实现可证明高效的探索?
- RQ2在轨迹型强化学习中,不确定性传播的反向归纳是否能提升样本效率?
- RQ3与当前最先进探索方法(如 BEBU、RND 和 NoisyNet)相比,OB2I 在性能和鲁棒性方面表现如何?
- RQ4所提出的 UCB 奖励在线性 MDP 中是否与 LSVI-UCB 保持理论一致性?
- RQ5为何 OB2I 在蒙特祖马的历险(Montezuma’s Revenge)等短时 horizon 环境中表现不佳?
主要发现
- 在 MNIST Maze 环境中,OB2I 显著优于 BEBU、BEBU-UCB、BEBU-IDS 等 SOTA 方法,平均回报更高。
- 在包含 49 个游戏的 Atari 套件中,OB2I 在所有对比方法中取得最高的中位数和平均分,其中在 Ms. Pacman 上中位数得分为 1,794.9,在 Video Pinball 上为 80,607.0。
- 该方法在长时序依赖的游戏上表现显著提升,表明反向不确定性传播在长轨迹中最为有效。
- 在多个游戏中(如 Video Pinball 和 Road Runner),OB2I 相较于 BEBU 实现了超过 100% 的相对得分提升。
- 失败分析显示,OB2I 在 Montezuma’s Revenge 中表现不佳,因短时 horizon 限制了反向不确定性传播的优势,尽管仍优于基线 DQN 和 BootDQN。
- 理论分析证实,OB2I 的 UCB 奖励与线性 MDP 中的 LSVI-UCB 奖励等价,验证了其与可证明高效探索方法的一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。