[论文解读] Geometric Entropic Exploration
该论文提出几何熵最大化(GEM),一种新颖的强化学习探索算法,通过噪声对比估计目标,最大化状态访问的几何感知香农熵。GEM通过同时学习策略与几何相似性函数,在离散和连续环境中均实现高效探索,在稀疏奖励任务中优于RND和NGU,展现出更优的状态覆盖范围与样本效率。
Exploration is essential for solving complex Reinforcement Learning (RL) tasks. Maximum State-Visitation Entropy (MSVE) formulates the exploration problem as a well-defined policy optimization problem whose solution aims at visiting all states as uniformly as possible. This is in contrast to standard uncertainty-based approaches where exploration is transient and eventually vanishes. However, existing approaches to MSVE are theoretically justified only for discrete state-spaces as they are oblivious to the geometry of continuous domains. We address this challenge by introducing Geometric Entropy Maximisation (GEM), a new algorithm that maximises the geometry-aware Shannon entropy of state-visits in both discrete and continuous domains. Our key theoretical contribution is casting geometry-aware MSVE exploration as a tractable problem of optimising a simple and novel noise-contrastive objective function. In our experiments, we show the efficiency of GEM in solving several RL problems with sparse rewards, compared against other deep RL exploration approaches.
研究动机与目标
- 为解决现有最大状态访问熵(MSVE)方法的局限性,这些方法在理论上仅适用于离散状态空间,且在连续领域中忽略几何结构。
- 开发一种可计算的、几何感知的探索方法,确保在离散与连续状态空间中实现均匀的状态访问。
- 克服几何感知熵最大化过程中相似性函数坍塌与不可计算梯度估计的挑战。
- 通过学习一个平稳的随机策略,结合统一的优化目标,实现稳定且不衰减的探索,覆盖整个状态空间。
- 引入邻接正则化,确保学习到的相似性函数能捕捉状态之间的有意义几何关系。
提出的方法
- GEM将几何感知的MSVE形式化为噪声对比估计(NCE)问题,实现策略与状态访问分布联合优化的可计算且无偏梯度估计。
- 提出一种新颖的噪声对比目标,利用学习到的相似性函数 $k(x,x')$ 最大化状态访问的几何感知香农熵。
- 通过邻接正则化(AR)对相似性函数 $k$ 进行正则化,促使时间上相近的状态在嵌入空间中靠得更近,而独立采样的状态则被推得更远。
- GEM通过单一可微目标联合优化策略与相似性函数,避免了直接熵最大化带来的不可计算性。
- 该方法采用深度神经网络架构,包含共享编码器(躯干)、用于策略、价值与相似性预测的独立头,以及用于序列处理的LSTM核心。
- 超参数按环境进行调优,包括权重衰减、学习率与内在奖励缩放系数,训练在100,000步内使用Adam优化器完成。
实验结果
研究问题
- RQ1几何感知熵最大化能否在离散与连续状态空间中均被形式化为可计算的优化问题?
- RQ2如何在不退化至忽略几何结构的退化形式的前提下学习相似性函数 $k$?
- RQ3所提出的噪声对比目标是否能在稀疏奖励环境中实现稳定且有效的探索?
- RQ4与RND和NGU等现有探索方法相比,GEM在样本效率与状态覆盖方面表现如何?
- RQ5AR正则化能否在具有非对称或不可逆转移的环境中有效保持几何结构?
主要发现
- GEM在2-Rooms、16-Leaves、CartPole Swingup与Mountain Car等稀疏奖励环境中达到最先进性能,相较于RND与NGU在样本效率与最终性能上均有提升。
- GEM学习到的相似性函数成功捕捉了几何结构,体现在嵌入空间中状态配置的有意义聚类,即使在非对称转移环境中亦然。
- 在2-Keys网格世界中,GEM正确地根据钥匙收集状态与门状态对状态进行分组,不同配置具有明显区分的嵌入,展现出几何感知能力。
- 邻接正则化(AR)组件有效防止了相似性函数坍塌,确保时间上接近的状态被紧密嵌入,而独立采样的状态则被有效分离。
- GEM维持了稳定的探索行为,内在奖励不衰减,实现了跨回合的稳定且均匀的状态访问。
- 定量结果表明,GEM在所有评估环境中均实现了更高的最终回报与更快的学习曲线,且在高难度探索任务中的成功率显著优于RND与NGU。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。