[论文解读] Dynamic Bottleneck for Robust Self-Supervised Exploration
本文提出动态瓶颈(DB),一种自监督探索方法,通过信息瓶颈原理学习与动力学相关的表征,以过滤噪声。通过最大化潜在表征与下一状态之间的互信息,同时最小化无关的状态-动作依赖,DB-bonus 基于信息增益度量内在新颖性,在噪声 Atari 环境中稀疏奖励下表现优于最先进方法。
Exploration methods based on pseudo-count of transitions or curiosity of dynamics have achieved promising results in solving reinforcement learning with sparse rewards. However, such methods are usually sensitive to environmental dynamics-irrelevant information, e.g., white-noise. To handle such dynamics-irrelevant information, we propose a Dynamic Bottleneck (DB) model, which attains a dynamics-relevant representation based on the information-bottleneck principle. Based on the DB model, we further propose DB-bonus, which encourages the agent to explore state-action pairs with high information gain. We establish theoretical connections between the proposed DB-bonus, the upper confidence bound (UCB) for linear case, and the visiting count for tabular case. We evaluate the proposed method on Atari suits with dynamics-irrelevant noises. Our experiments show that exploration with DB bonus outperforms several state-of-the-art exploration methods in noisy environments.
研究动机与目标
- 解决现有内在好奇心和伪计数方法在存在与动力学无关的噪声(如相机噪声或随机运动)环境中的不稳定性问题。
- 开发一种表征学习方法,通过应用信息瓶颈原理仅捕捉与动力学相关的特征。
- 设计一种新颖的内在奖励——DB-bonus,基于动力学相关表征中的信息增益来度量状态-动作新颖性。
- 建立 DB-bonus 与线性 MDP 中的 UCB 及表格型 MDP 中访问次数之间的理论联系。
- 评估 DB-bonus 在噪声动力学下自监督探索中的鲁棒性与有效性,特别是在 Montezuma’s Revenge 等稀疏奖励设置中。
提出的方法
- DB 模型使用信息瓶颈原理,学习状态-动作对 $ (S_t, A_t) $ 的潜在表征 $ Z_t $,以最大化 $ I(Z_t; S_{t+1}) $,即表征与下一状态之间的互信息。
- 模型最小化 $ I([S_t, A_t]; Z_t) $,即输入与表征之间的互信息,以压缩与动力学无关的特征。
- 采用对比学习来优化 $ I(Z_t; S_{t+1}) $ 的下界,使模型能够学习解耦的、与动力学相关的表征。
- DB-bonus 计算为相对于所学习的 DB 表征的状态-动作对的信息增益,以鼓励探索高不确定性转移。
- 通过双目标端到端训练:通过互信息最小化实现表征解耦,通过互信息最大化实现预测性能。
- 建立 DB-bonus 与线性 MDP 中的 UCB 及表格型 MDP 中访问次数之间的理论联系,表明其与可证明高效的探索一致。
实验结果
研究问题
- RQ1基于信息瓶颈原理的表征学习方法能否有效过滤强化学习中与动力学无关的噪声?
- RQ2所提出的 DB-bonus 在理论基础和实证性能方面与 UCB 和访问次数相比如何?
- RQ3DB-bonus 在注入噪声的环境中是否比现有好奇心和伪计数方法带来更鲁棒的探索?
- RQ4在稀疏奖励的复杂环境(如 Montezuma’s Revenge)中,DB 模型能否学习到有意义且解耦的表征?
- RQ5在噪声和粘滞动作条件下,DB-bonus 的性能与基于熵的探索方法相比如何?
主要发现
- 在注入了与动力学无关噪声的 Random-Box Atari 环境中,DB-bonus 表现优于多种最先进探索方法,展现出对噪声的强鲁棒性。
- DB-bonus 方法使智能体在自监督学习下成功通过 Montezuma’s Revenge 的第一半关卡,而所有基线方法得分均为零。
- t-SNE 可视化表明,DB 表征形成了有意义且语义聚类的结构(如跳跃、下落、逃脱),而原始状态则无此类聚类。
- 该方法在具有粘滞性动作的环境中表现出色,表明对动作扰动具有强鲁棒性。
- 与基于熵的方法(如 RE3)相比,后者在噪声下因状态熵增加而性能显著下降,而 DB-bonus 保持有效,凸显其抗噪声能力。
- 在 Gopher 环境中的尖峰分析显示,高 DB-bonus 事件对应于稀有且高影响力的转移(如地鼠挖洞),这些是获取高奖励的关键。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。