[论文解读] Is Curiosity All You Need? On the Utility of Emergent Behaviours from Curious Exploration
本文提出保留强化学习中基于好奇心探索产生的涌现行为,认为这些虽短暂但自发现的技能可被用于下游任务迁移。通过一种离策略好奇心方法(SelMo),作者表明,简单的策略快照即可捕捉多样且有用的技能,从而在复杂操控与运动任务中实现与人工设计课程相当的性能。
Curiosity-based reward schemes can present powerful exploration mechanisms which facilitate the discovery of solutions for complex, sparse or long-horizon tasks. However, as the agent learns to reach previously unexplored spaces and the objective adapts to reward new areas, many behaviours emerge only to disappear due to being overwritten by the constantly shifting objective. We argue that merely using curiosity for fast environment exploration or as a bonus reward for a specific task does not harness the full potential of this technique and misses useful skills. Instead, we propose to shift the focus towards retaining the behaviours which emerge during curiosity-based learning. We posit that these self-discovered behaviours serve as valuable skills in an agent's repertoire to solve related tasks. Our experiments demonstrate the continuous shift in behaviour throughout training and the benefits of a simple policy snapshot method to reuse discovered behaviour for transfer tasks.
研究动机与目标
- 探究在连续控制环境中,基于好奇心探索的涌现行为是否对下游任务学习有用。
- 解决基于好奇心探索的局限性,即行为因目标变化和灾难性遗忘而出现又消失。
- 提出一种识别并重用这些瞬态行为作为分层学习设置中可复用技能的方法。
- 评估基于好奇心学习自发现的行为是否能与人工设计的课程学习方法相匹配或超越其性能。
- 探索将基于好奇心的探索不仅用于探索,还作为自监督技能库以支持持续学习的可行性。
提出的方法
- 提出 SelMo,一种基于前向预测世界模型的离策略好奇心探索实现方法,用于生成内在好奇心奖励。
- 训练策略以最大化状态转移上的预测误差,从而在无需外部奖励塑造的情况下鼓励探索新状态。
- 在不同训练阶段收集并存储策略快照,以表示随时间演变的特定涌现行为。
- 将这些快照用作分层强化学习设置中固定且可复用的技能,用于下游任务。
- 采用模块化训练流程,使每个快照在新任务上独立微调,从而实现技能复用而无需从头开始训练。
- 在模拟环境中的复杂9-DoF JACO机械臂和20-DoF OP3人形机器人环境中评估性能。
实验结果
研究问题
- RQ1能否识别并保留基于好奇心探索的涌现行为,作为下游任务的可复用技能?
- RQ2在复杂操控与运动任务中,基于好奇心生成快照训练的策略性能与人工设计课程相比如何?
- RQ3基于好奇心学习自发现的行为在无需显式奖励塑造的情况下,能在多大程度上捕捉多样且与任务相关的技能?
- RQ4与在线策略好奇心方法相比,离策略训练是否能提升涌现行为的多样性与稳定性?
- RQ5仅通过简单快照方法是否能有效实现跨任务的技能迁移,而无需额外的奖励工程?
主要发现
- 在3D机器人环境中,基于好奇心的训练过程中自然涌现出复杂且多样的行为,如抓取、抓握、举起和行走步态等。
- 将策略快照作为可复用技能使用,在JACO和OP3机器人上的下游操控任务中实现了与人工设计课程相当的性能。
- 尽管好奇心目标不断变化,仍有一部分涌现行为保持稳定并可在不同任务间迁移,表明其作为内在技能的实用性。
- 离策略实现(SelMo)相比在线策略方法产生了更多样化且更稳定的涌现行为,提升了数据效率与技能多样性。
- 该方法表明,基于好奇心的探索不仅可作为发现机制,还可作为自监督技能库的来源。
- 即使没有显式奖励塑造,自发现的行为也覆盖了广泛的与任务相关技能,表明其在长时程和多任务设置中的可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。