[论文解读] On the Importance of Exploration for Generalization in Reinforcement Learning
本文提出Ede(Exploration via Distributional Ensemble),一种基于值函数的强化学习方法,通过在上下文M DP中鼓励对具有高认知不确定性状态的探索,提升泛化能力。Ede在Procgen和Crafter基准上均达到最先进性能,优于以往基于值函数和策略优化的方法,明确将探索作为提升泛化能力的关键机制。
Existing approaches for improving generalization in deep reinforcement learning (RL) have mostly focused on representation learning, neglecting RL-specific aspects such as exploration. We hypothesize that the agent's exploration strategy plays a key role in its ability to generalize to new environments. Through a series of experiments in a tabular contextual MDP, we show that exploration is helpful not only for efficiently finding the optimal policy for the training environments but also for acquiring knowledge that helps decision making in unseen environments. Based on these observations, we propose EDE: Exploration via Distributional Ensemble, a method that encourages exploration of states with high epistemic uncertainty through an ensemble of Q-value distributions. Our algorithm is the first value-based approach to achieve state-of-the-art on both Procgen and Crafter, two benchmarks for generalization in RL with high-dimensional observations. The open-sourced implementation can be found at https://github.com/facebookresearch/ede .
研究动机与目标
- 探究探索策略是否在深度强化学习中对泛化能力产生显著影响,而这种影响超越了表征学习的范畴。
- 识别探索作为上下文M DP(CMDP)中泛化能力的关键因素,其中智能体在多样化但结构相似的环境中进行训练。
- 开发一种显式针对认知不确定性以引导探索的方法,从而提升对未见过环境的泛化能力。
- 证明在一个环境中进行的探索可产生可迁移的知识,有助于提升在同一系列中其他未见过环境中的决策能力。
- 在Procgen和Crafter等泛化基准上,使用无模型、基于值函数的方法实现最先进性能。
提出的方法
- Ede使用Q值分布的集成来建模认知不确定性,集成中的每个成员均预测回报的分布。
- 通过集成中的预测结果计算不确定性估计,识别出智能体具有高认知不确定性的状态,表明这些区域需要进一步探索。
- 探索由基于集成预测不确定性的上置信度边界(UCB)风格奖励引导,鼓励访问不确定性较高的状态。
- 为实现高效推理,Ede在Crafter实验中采用Thompson采样,而在Procgen中使用UCB,超参数通过消融实验调优。
- 特征提取器通过同时来自所有集成头的梯度进行训练,确保共享表征学习与不确定性估计保持一致。
- 该方法应用于QR-DQN(分位数回归DQN)框架中,采用Huber损失和基于分位数的值估计。

实验结果
研究问题
- RQ1探索策略是否在上下文M DP中显著影响泛化性能,而这种影响超越了表征学习的范畴?
- RQ2在某一环境中通过探索获得的知识是否能够迁移到同一系列中其他未见过环境的决策优化中?
- RQ3通过Q值分布的集成进行认知不确定性估计,是否能有效引导探索,从而在高维观测空间中提升泛化能力?
- RQ4是否可能通过显式针对探索的基于值函数方法,在深度强化学习中实现最先进泛化性能,而无需依赖策略优化或模型基方法?
- RQ5所提出方法对超参数选择(如探索奖励系数和集成规模)的鲁棒性如何?
主要发现
- Ede在Procgen基准上达到最先进性能,优于SAC和DQN-BC等强策略优化基线方法,以及模型基基线方法。
- 在Crafter基准上,Ede超越了以往基于值函数的方法,且在性能上与或超过策略优化方法,展现出强大的泛化能力和样本效率。
- 在使用基于不确定性的探索时,测试性能显著提升,尤其在训练中最优轨迹在未见环境中可能并非最优的环境中表现更明显。
- 消融实验表明,通过所有集成成员的梯度联合训练特征提取器可提升性能,而仅使用单一头则导致性能下降。
- 该算法对超参数选择具有鲁棒性:在TEE奖励中λ和α的不同取值下性能保持稳定,且对UCB中的φ仅表现出轻微敏感性。
- Ede是首个在Procgen和Crafter上均实现SOTA的无模型、基于值函数方法,验证了探索作为深度强化学习中泛化关键机制的有效性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。