Skip to main content
QUICK REVIEW

[论文解读] Bayesian Curiosity for Efficient Exploration in Reinforcement Learning

Tom Blau, Lionel Ott|arXiv (Cornell University)|Nov 20, 2019
Reinforcement Learning in Robotics参考文献 33被引用 6
一句话总结

本文提出贝叶斯好奇心(Bayesian Curiosity),一种计算高效的内在奖励方法,通过在学习到的潜在空间中使用贝叶斯线性回归来衡量状态新颖性并引导探索。通过奖励未探索区域中的不确定性,该方法在高维、连续控制任务中加速了学习,尤其是在稀疏奖励环境下,其在仿真和真实机器人实验中均优于 $\epsilon$-greedy 和 RND 基线方法。

ABSTRACT

Balancing exploration and exploitation is a fundamental part of reinforcement learning, yet most state-of-the-art algorithms use a naive exploration protocol like $ε$-greedy. This contributes to the problem of high sample complexity, as the algorithm wastes effort by repeatedly visiting parts of the state space that have already been explored. We introduce a novel method based on Bayesian linear regression and latent space embedding to generate an intrinsic reward signal that encourages the learning agent to seek out unexplored parts of the state space. This method is computationally efficient, simple to implement, and can extend any state-of-the-art reinforcement learning algorithm. We evaluate the method on a range of algorithms and challenging control tasks, on both simulated and physical robots, demonstrating how the proposed method can significantly improve sample complexity.

研究动机与目标

  • 解决高维连续状态空间中因探索效率低下导致的高样本复杂度问题。
  • 克服如 $\epsilon$-greedy 和高斯噪声等朴素探索策略的局限性,避免重复访问已知状态造成资源浪费。
  • 开发一种可扩展、模块化的内在奖励机制,可与任意先进强化学习算法无缝集成。
  • 在外部奖励提供极少引导的稀疏奖励环境中提升样本效率。
  • 在不同随机初始化条件下展现鲁棒性,并在仿真和真实机器人控制任务中实现良好泛化能力。

提出的方法

  • 使用学习到的潜在空间嵌入将高维观测(如 RGB-D 图像)映射到低维、有意义的表示。
  • 应用贝叶斯线性回归(BLR)建模潜在状态与预测结果之间的关系,并估计模型不确定性。
  • 将 BLR 模型的预测方差作为任意给定状态的不确定性度量,其值随与先前观测状态距离的增加而上升。
  • 生成与模型不确定性成比例的内在奖励信号,激励智能体探索远离先前访问区域的状态。
  • 将内在奖励信号无缝集成到标准强化学习算法(如 TRPO、SAC)中,无需修改策略网络或价值函数架构。
  • 使用对比学习目标端到端联合训练潜在空间嵌入与强化学习策略,以保持状态间的相似性与差异性。

实验结果

研究问题

  • RQ1基于贝叶斯不确定性的内在奖励信号是否能提升高维观测下连续控制任务的样本效率?
  • RQ2与 $\epsilon$-greedy 和 RND 相比,贝叶斯好奇心在收敛速度和对随机初始化的鲁棒性方面表现如何?
  • RQ3该方法在稀疏奖励环境或复杂状态空间几何结构(如成功与失败状态之间的瓶颈)中是否表现更优?
  • RQ4该内在好奇心信号是否能在不同观测模态(包括原始 RGB-D 图像)上实现良好泛化?
  • RQ5在每次试 epoch 成本高昂的真实机器人控制任务中,该方法的可扩展性如何?

主要发现

  • 贝叶斯好奇心显著降低了样本复杂度:在视觉运动抓取任务中,即使训练时间仅为基线的 1/3,其性能仍优于 RND 和原始 TRPO。
  • 该方法在多个随机种子下的性能第一四分位数显著提升,表明其在初始化敏感性方面优于基线,具有更强的鲁棒性。
  • 在具有稀疏奖励和几何瓶颈(失败状态靠近成功状态)的抓取任务中,贝叶斯好奇心收敛速度远超基线,后者表现出近乎线性的学习曲线。
  • 在真实机械臂上,贝叶斯好奇心的中位性能与 RND 相当,但在第一四分位数中收敛更快,表明其在真实世界设置中具备实际鲁棒性。
  • 在高维视觉观测空间中,该方法优于使用高斯噪声的朴素探索策略,后者在这些场景中难以有效探索。
  • 基于模型不确定性的内在奖励能有效引导复杂状态空间中的探索,尤其在外部奖励稀疏或具有误导性时表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。