Skip to main content
QUICK REVIEW

[论文解读] BYOL-Explore: Exploration by Bootstrapped Prediction

Zhaohan Daniel Guo, Shantanu Thakoor|arXiv (Cornell University)|Jun 16, 2022
Reinforcement Learning in Robotics被引用 5
一句话总结

BYOL-Explore 提出了一种统一的自监督方法,通过在潜在空间中利用自举预测,联合学习世界表征与探索策略,实现了在视觉复杂环境中的好奇心驱动探索。该方法仅使用内在奖励,就在具有挑战性的 DM-HARD-8 基准上达到了人类水平性能,优于以往需要人类示范的方法。

ABSTRACT

We present BYOL-Explore, a conceptually simple yet general approach for curiosity-driven exploration in visually-complex environments. BYOL-Explore learns a world representation, the world dynamics, and an exploration policy all-together by optimizing a single prediction loss in the latent space with no additional auxiliary objective. We show that BYOL-Explore is effective in DM-HARD-8, a challenging partially-observable continuous-action hard-exploration benchmark with visually-rich 3-D environments. On this benchmark, we solve the majority of the tasks purely through augmenting the extrinsic reward with BYOL-Explore s intrinsic reward, whereas prior work could only get off the ground with human demonstrations. As further evidence of the generality of BYOL-Explore, we show that it achieves superhuman performance on the ten hardest exploration games in Atari while having a much simpler design than other competitive agents.

研究动机与目标

  • 解决在视觉丰富、部分可观测环境中,稀疏外在奖励下的高效探索挑战。
  • 在单一自监督预测目标下,统一世界表征学习与好奇心驱动策略学习。
  • 在困难探索设置中,消除对外部目标、人类示范或复杂记忆机制的依赖。
  • 在多样化、高维控制任务中实现泛化,包括 DM-HARD-8 和 Atari。

提出的方法

  • 采用受 BYOL 启发的自举潜在预测机制,智能体预测其自身潜在表征的延迟目标版本。
  • 将潜在空间中的预测损失作为唯一学习目标,用于表征学习与内在奖励设计。
  • 使用 EMA(指数移动平均)目标网络以稳定训练并提升表征一致性。
  • 采用多步开环预测(预测时域 K)以鼓励长期规划与未来状态预测。
  • 通过截断对内在奖励进行归一化,以稳定学习并提升样本效率。
  • 使用单一损失函数联合训练单一策略网络与世界模型,实现无需辅助目标的端到端训练。

实验结果

研究问题

  • RQ1在潜在空间中,单一自监督预测损失是否能有效驱动在视觉复杂、部分可观测环境中的探索?
  • RQ2自举潜在预测是否优于传统好奇心方法(如 ICM 和 RND)在困难探索基准上的表现?
  • RQ3统一的世界模型与策略训练框架是否能在无需人类示范的情况下实现人类水平性能?
  • RQ4该方法对超参数选择(如预测时域 K 和 EMA 衰减 α)的鲁棒性如何?
  • RQ5该方法是否能在多样化环境中泛化,包括稀疏奖励的 3D 环境和 Atari 游戏?

主要发现

  • BYOL-Explore 仅使用外在奖励与内在奖励的组合,在 DM-HARD-8 基准的 8 项任务中有 7 项达到人类水平性能,且无需人类示范。
  • 在所有 DM-HARD-8 任务中,该方法均优于 ICM 和 RND,即使这些基线方法已分别调优至最佳性能。
  • 随着预测时域 K 的增加,性能平滑提升,表明多步未来预测可增强探索效率。
  • 该方法对 EMA 衰减参数 α 具有鲁棒性,最优性能出现在 α = 0.99,且在超参数变化下仍保持稳定学习。
  • BYOL-Explore 在十个最困难的 Atari 探索游戏中实现超人类性能,且模型架构比 Agent57 和 Go-Explore 更为简单。
  • 即使在共享参数与每项任务数据减少的多任务设置下,BYOL-Explore 仍优于单任务基线方法,证实其样本效率与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。