[论文解读] Curiosity-driven reinforcement learning with homeostatic regulation
该论文提出了一种基于好奇心的强化学习算法,通过引入稳态调节机制,以在连续控制环境中平衡探索与稳定性。通过将信息论的内在奖励与优先关注复杂非线性区域学习的稳态驱动相结合,该方法提高了前向模型的准确性与样本效率,在复杂环境中的表现优于纯好奇心驱动的方法。
We propose a curiosity reward based on information theory principles and consistent with the animal instinct to maintain certain critical parameters within a bounded range. Our experimental validation shows the added value of the additional homeostatic drive to enhance the overall information gain of a reinforcement learning agent interacting with a complex environment using continuous actions. Our method builds upon two ideas: i) To take advantage of a new Bellman-like equation of information gain and ii) to simplify the computation of the local rewards by avoiding the approximation of complex distributions over continuous states and actions.
研究动机与目标
- 解决纯好奇心驱动探索的局限性,即可能忽略需要稳定、重复交互才能学习的区域。
- 在人工智能体中建模探索(异稳态)与维持生理稳定(稳态)的双重生物驱动力。
- 通过基于信息增益与熟悉度调节内在奖励,提升前向模型学习效率。
- 验证将好奇心与稳态调节相结合是否能提升在非线性、复杂环境中的学习效果。
提出的方法
- 提出一种新颖的内在奖励函数,结合异稳态好奇心(通过条件互信息衡量的信息增益)与稳态调节(对过去状态-动作对的熟悉度)。
- 利用因果条件定向互信息推导出信息增益的贝尔曼类似递归方程,实现时间信用分配。
- 通过避免对连续状态和动作的复杂分布近似,简化了局部奖励的计算。
- 使用前向模型 $ f $ 和扩展前向模型 $ k $ 预测状态转移,其中稳态项对偏离熟悉状态-动作模式的行为施加惩罚。
- 采用DDPG算法,结合混合奖励:$ r_t = ext{IG}(s_t) + rac{eta}{2} ext{Fam}(s_t, a_t) $,其中 $ ext{IG} $ 表示信息增益,$ ext{Fam} $ 衡量熟悉度。
- 在连续控制设置中,通过经验回放和小批量更新联合训练智能体与内部模型。
实验结果
研究问题
- RQ1稳态驱动能否提升在复杂非线性环境中好奇心驱动探索的效率?
- RQ2通过基于熟悉度的奖励调节内在好奇心,对前向模型学习准确性有何影响?
- RQ3异稳态与稳态驱动的结合是否比纯好奇心方法具有更高的样本效率?
- RQ4智能体能否通过稳态调节优先学习高非线性区域(例如三室环境中的'门')?
主要发现
- 增加稳态成分 $ eta $(或 $ ar{eta} $)可提升前向模型准确性,$ eta = 7 $ 时达到最低均方误差(MSE),尽管由于实验条件不同,绝对MSE高于随机采样。
- 当 $ eta = 7 $ 时,智能体学习到一种策略,能主动将自身定位在非线性区域(如'门')附近,表明对复杂动力学区域的探索优先化。
- 在受限起始条件(仅底部房间)下,该稳态-好奇心智能体在15万次回合内平均进入顶部房间超过1,000次,远超纯随机探索的145次。
- 该方法通过聚焦于学习最困难的区域,提升了环境采样效率,表现为对高曲率状态-动作区域的覆盖更优。
- 混合奖励策略相比纯好奇心或随机基线,产生了更结构化且高效的探索模式。
- 结果表明,稳态调节可防止在低信息区域的过度探索,并将好奇心引导至学习丰富的区域。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。