[论文解读] SMiRL: Surprise Minimizing Reinforcement Learning in Unstable Environments
本文提出了一种无监督强化学习方法——惊喜最小化强化学习(SMiRL),该方法通过寻求稳定、可预测的状态来最小化环境中的惊喜,从而训练智能体。通过迭代更新状态密度模型并优化策略以到达高概率状态,SMiRL使智能体能够自主学习复杂行为——如玩俄罗斯方块、平衡人形机器人以及躲避敌人——而无需特定任务的奖励信号,同时在用作辅助目标时还能加速基于奖励的学习。
Every living organism struggles against disruptive environmental forces to carve out and maintain an orderly niche. We propose that such a struggle to achieve and preserve order might offer a principle for the emergence of useful behaviors in artificial agents. We formalize this idea into an unsupervised reinforcement learning method called surprise minimizing reinforcement learning (SMiRL). SMiRL alternates between learning a density model to evaluate the surprise of a stimulus, and improving the policy to seek more predictable stimuli. The policy seeks out stable and repeatable situations that counteract the environment's prevailing sources of entropy. This might include avoiding other hostile agents, or finding a stable, balanced pose for a bipedal robot in the face of disturbance forces. We demonstrate that our surprise minimizing agents can successfully play Tetris, Doom, control a humanoid to avoid falls, and navigate to escape enemies in a maze without any task-specific reward supervision. We further show that SMiRL can be used together with standard task rewards to accelerate reward-driven learning.
研究动机与目标
- 开发一种无监督强化学习方法,使智能体通过最小化环境惊喜而非追求新颖性来学习有用行为。
- 解决在开放世界环境中学习的挑战,其中自然扰动增加了熵,使得稳定性和可预测性比探索更为关键。
- 证明惊喜最小化可产生语义上有意义的协调行为,如保持平衡、玩游戏和躲避敌人,且无需特定任务的奖励信号。
- 探索SMiRL作为辅助奖励信号在密集奖励环境中加速学习的实用性。
提出的方法
- SMiRL维护一个状态密度模型 $p_{\theta}(\mathbf{s})$,用于估计已访问状态的分布,并使用新的状态观测值进行更新。
- 策略基于 $p_{\theta}(\mathbf{s})$ 的参数进行条件化,以生成导向低惊喜状态(即在当前模型下高概率)的动作。
- 在每一步,智能体接收奖励 $r_t = -\log p_{\theta_{t-1}}(\mathbf{s}_t)$,该值衡量当前状态的负对数概率。
- 该方法在更新状态密度模型和改进策略之间交替进行,从而在不断演化的状态分布下形成一个平稳的马尔可夫决策过程(MDP)。
- SMiRL被应用于完全无监督的设置,以及与任务奖励结合使用,其中 $r_{\text{combined}} = r_{\text{task}} + \alpha r_{\text{SMiRL}}$。
- 该方法可通过使用专家示范初始化 $p_{\theta}(\mathbf{s})$ 来整合先验数据,从而在不改变算法的前提下实现一种模仿学习形式。
实验结果
研究问题
- RQ1在无任何特定任务奖励设计的不稳定环境中,惊喜最小化能否催生出复杂且协调的行为?
- RQ2在具有高自然熵和持续扰动的环境中,SMiRL与追求新颖性的内在好奇心方法相比表现如何?
- RQ3SMiRL能否作为有效的辅助奖励信号,加速密集奖励环境中学习,尤其是在避免灾难性后果至关重要的场景中?
- RQ4SMiRL在在多大程度上可与先验示范结合,以提高样本效率并减少训练过程中的失败?
主要发现
- SMiRL使智能体在无任何特定任务奖励信号的情况下,成功实现了俄罗斯方块游戏、在《DOOM》中导航并击败敌人,以及在悬崖边缘平衡人形机器人。
- 在俄罗斯方块和TakeCover环境中,SMiRL显著优于先前的内在好奇心方法,尤其在更难的变体中,大幅减少了死亡和跌倒次数。
- 当与任务奖励结合使用时,SMiRL在Walk和DefendTheLine任务中加速了学习,且当使用先验行走轨迹初始化状态密度模型时,性能达到最佳。
- 使用先验数据初始化的SMiRL变体显著减少了跌倒次数并提高了样本效率,表明先验知识可无缝集成到惊喜最小化框架中。
- SMiRL的行为对状态表征高度敏感,表明通过选择合适的观测模态,可引导行为设计。
- 该方法表明,最小化惊喜可促使产生抵抗环境熵的稳态行为,如建造庇护所或维持平衡,即使在缺乏显式奖励的情况下亦然。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。