[论文解读] State Entropy Maximization with Random Encoders for Efficient Exploration
该论文提出RE3,一种计算高效的探索方法,通过使用固定随机编码器提取低维表示,以最大化状态熵,从而在高维观测空间中实现稳定且可扩展的熵估计。RE3在DeepMind Control Suite、MiniGrid和Atari基准测试中,显著提升了模型无关和模型相关强化学习的样本效率,优于需要学习表示或辅助模型的方法。
Recent exploration methods have proven to be a recipe for improving sample-efficiency in deep reinforcement learning (RL). However, efficient exploration in high-dimensional observation spaces still remains a challenge. This paper presents Random Encoders for Efficient Exploration (RE3), an exploration method that utilizes state entropy as an intrinsic reward. In order to estimate state entropy in environments with high-dimensional observations, we utilize a k-nearest neighbor entropy estimator in the low-dimensional representation space of a convolutional encoder. In particular, we find that the state entropy can be estimated in a stable and compute-efficient manner by utilizing a randomly initialized encoder, which is fixed throughout training. Our experiments show that RE3 significantly improves the sample-efficiency of both model-free and model-based RL methods on locomotion and navigation tasks from DeepMind Control Suite and MiniGrid benchmarks. We also show that RE3 allows learning diverse behaviors without extrinsic rewards, effectively improving sample-efficiency in downstream tasks. Source code and videos are available at https://sites.google.com/view/re3-rl.
研究动机与目标
- 解决深度强化学习中常见的高维观测空间下的高效探索挑战。
- 在无需表示学习或辅助模型的情况下,实现稳定且计算高效的熵估计。
- 探究随机初始化的编码器是否能为状态熵估计提供有意义的表示。
- 通过基于状态熵的内在奖励设计,提升模型无关和模型相关强化学习算法的样本效率。
- 通过在稀疏奖励环境中鼓励多样化行为,实现下游任务的有效预训练。
提出的方法
- 在随机初始化的卷积编码器的潜在空间中使用k近邻(k-NN)熵估计器来估计状态熵。
- 在整个训练过程中固定编码器权重,避免反向传播更新或表示学习目标。
- 在固定潜在表示上应用k-NN估计器,计算与状态熵成比例的内在奖励。
- 将内在奖励集成到标准强化学习算法(如A2C、SAC)中,不修改策略或价值函数的学习过程。
- 利用卷积架构的归纳偏置,确保在未训练的情况下也能获得有意义的状态相似性表示。
- 在模型无关(如A2C、SAC)、模型相关(如Dreamer)以及在线策略设置中应用该方法,仅需极少的超参数调优。
实验结果
研究问题
- RQ1固定且随机初始化的编码器是否能在高维环境中为状态熵估计提供稳定且有意义的表示空间?
- RQ2通过在固定随机编码器空间中使用k-NN估计器最大化状态熵,是否能提升深度强化学习的样本效率?
- RQ3与依赖学习表示或辅助模型的最先进探索方法相比,RE3表现如何?
- RQ4RE3是否能通过在稀疏奖励环境中鼓励多样化行为,实现对下游任务的有效预训练?
- RQ5该方法在视觉复杂的环境(如Atari游戏)中是否具备可扩展性和有效性?
主要发现
- 在DoorKey-8x8 MiniGrid环境中,RE3在240万次环境交互步数时达到平均回合回报0.49,优于A2C + ICM(0.20)和A2C + RND,后两者均未能学习到非平凡策略。
- 在MiniGrid Empty-16x16环境中,RE3支持预训练,显著提升了下游微调性能,A2C + RE3 + PT在DoorKey任务中展现出更优的样本效率。
- 在Atari游戏中,RE3在Rainbow和Rainbow + SE(对比学习)的基础上进一步提升了样本效率,尤其在Montezuma’s Revenge等高难度探索游戏上表现突出。
- 在MiniGrid中,RE3优于依赖表示学习(如对比学习)的方法,因为数据增强与紧凑的状态嵌入不兼容。
- 该方法计算高效,编码器无需梯度更新,因此在现有强化学习流程中易于扩展和实用化。
- RE3无需外部奖励即可学习多样化行为,证明其在大型空旷状态空间中具备有效的内在探索能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。