[论文解读] Interesting Object, Curious Agent: Learning Task-Agnostic Exploration
本文提出基于变化的探索迁移(C-BET),一种与任务无关的探索框架,通过在多个环境中联合学习以智能体为中心和以环境为中心的探索策略,实现对未见环境的更好迁移。C-BET 通过结合内在好奇心与环境级别的有趣性,优于先前方法,在多样化测试场景中实现了更优的覆盖范围与一致性。
Common approaches for task-agnostic exploration learn tabula-rasa --the agent assumes isolated environments and no prior knowledge or experience. However, in the real world, agents learn in many environments and always come with prior experiences as they explore new ones. Exploration is a lifelong process. In this paper, we propose a paradigm change in the formulation and evaluation of task-agnostic exploration. In this setup, the agent first learns to explore across many environments without any extrinsic goal in a task-agnostic manner. Later on, the agent effectively transfers the learned exploration policy to better explore new environments when solving tasks. In this context, we evaluate several baseline exploration strategies and present a simple yet effective approach to learning task-agnostic exploration policies. Our key idea is that there are two components of exploration: (1) an agent-centric component encouraging exploration of unseen parts of the environment based on an agent's belief; (2) an environment-centric component encouraging exploration of inherently interesting objects. We show that our formulation is effective and provides the most consistent exploration across several training-testing environment pairs. We also introduce benchmarks and metrics for evaluating task-agnostic exploration strategies. The source code is available at https://github.com/sparisi/cbet/.
研究动机与目标
- 为解决强化学习中从零开始探索的局限性,将探索建模为一种终身可迁移的过程。
- 推动范式转变:从孤立的单环境探索转向多环境预训练,并实现向新环境的迁移。
- 识别并建模探索的两个组成部分:以智能体为中心(未探索状态)和以环境为中心(固有有趣的物体)。
- 开发基准和评估指标,用于在迁移设置中评估与任务无关的探索策略。
- 证明:从多样化环境中学习可提升探索策略的泛化能力与可迁移性。
提出的方法
- C-BET 使用以智能体为中心的惊喜(基于状态访问频次)和以环境为中心的变化检测(基于全景或本体视觉变化)相结合的方式学习探索策略。
- 该方法采用双组件内在奖励:一个基于智能体对未探索状态的信念,另一个基于高影响力环境变化(如可触发交互的物体,如门或开关)。
- 预训练在多个环境中进行,不依赖外部奖励,使智能体能够学习可迁移的探索行为。
- 在迁移阶段,预训练策略直接应用于新的未见环境中,无需进一步训练,以评估覆盖范围与一致性。
- 该框架同时使用全景和本体视觉编码来评估环境变化,消融研究表明结合两种模态至关重要。
- 消融研究将 C-BET 与基线方法(如 Count、Curiosity、RND 和 RIDE)进行比较,评估策略分布及在噪声条件下的鲁棒性。
实验结果
研究问题
- RQ1在无任务特定奖励的情况下,跨多个环境预训练的探索策略是否能有效泛化到未见环境中?
- RQ2与仅使用以智能体为中心的方法相比,结合以智能体为中心和以环境为中心的探索组件如何提升迁移性能?
- RQ3具有高内在有趣性的环境物体(如开关、钥匙)在引导有效探索中起到何种作用?
- RQ4环境中的噪声如何影响探索策略的鲁棒性与可迁移性?
- RQ5在多样化环境中进行预训练在多大程度上可减少对特定动作或状态的过拟合?
主要发现
- C-BET 在所有未见环境中均实现了最高且最一致的场景覆盖,在较小场景(如 Room 0 和 Room 1)中几乎访问了所有状态,且在较大场景(如 Apt. 0 和 Hotel 0)中单集内即覆盖了大部分状态。
- C-BET 在预训练和迁移阶段均优于所有基线方法(Count、Curiosity、RND、RIDE),尤其在视觉多样性高的环境中表现更优。
- 即使仅使用本体视觉编码,C-BET 仍保持强劲性能,表明其成功源于将本体状态频次与全景变化检测相结合,而非仅依赖全景频次。
- 在噪声环境中,C-BET 的策略分布保持稳定,对“下落”动作赋予低概率,并维持一致的动作概率;而 Count 则过度倾向“前进”动作,表现欠佳。
- 预训练期间存在重置对 Count 的性能至关重要,但 C-BET 即使无重置也能保持强大可迁移性,展现出更强鲁棒性。
- C-BET 的策略熵在所有设置中均保持较低水平(0.74–0.99),表明行为稳定且专注;而无重置的基线方法在噪声条件下几乎变为随机行为。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。