[论文解读] Task-agnostic Exploration in Reinforcement Learning
本文提出了一种与任务无关的强化学习框架,其中智能体在无任何奖励函数的情况下探索马尔可夫决策过程(MDP),随后利用收集的轨迹和采样的奖励,高效地为 N 个任意任务计算近似最优策略。所提出的 UCBZero 算法实现了 $\tilde{O}(\log(N)H^5SA/\varepsilon^2)$ 的样本复杂度,且匹配的下界证明了在此设置中 $\log(N)$ 依赖关系的必要性。
Efficient exploration is one of the main challenges in reinforcement learning (RL). Most existing sample-efficient algorithms assume the existence of a single reward function during exploration. In many practical scenarios, however, there is not a single underlying reward function to guide the exploration, for instance, when an agent needs to learn many skills simultaneously, or multiple conflicting objectives need to be balanced. To address these challenges, we propose the extit{task-agnostic RL} framework: In the exploration phase, the agent first collects trajectories by exploring the MDP without the guidance of a reward function. After exploration, it aims at finding near-optimal policies for $N$ tasks, given the collected trajectories augmented with extit{sampled rewards} for each task. We present an efficient task-agnostic RL algorithm, extsc{UCBZero}, that finds $ε$-optimal policies for $N$ arbitrary tasks after at most $ ilde O(\log(N)H^5SA/ε^2)$ exploration episodes. We also provide an $Ω(\log (N)H^2SA/ε^2)$ lower bound, showing that the $\log$ dependency on $N$ is unavoidable. Furthermore, we provide an $N$-independent sample complexity bound of extsc{UCBZero} in the statistically easier setting when the ground truth reward functions are known.
研究动机与目标
- 解决在探索阶段无任何预设奖励函数时,强化学习中高效探索的挑战。
- 设计一种框架,使得在单次无奖励探索阶段后,能够学习多个任意任务的近似最优策略。
- 建立与任务无关的强化学习的理论样本复杂度边界,捕捉在无奖励引导下学习的固有难度。
- 证明在该设置中样本复杂度的 $\log(N)$ 依赖关系是不可避免的。
- 提供任务特定、无奖励和与任务无关的强化学习范式之间的统一理论比较。
提出的方法
- 智能体在无任何奖励信号的情况下对 MDP 进行探索,使用基于不确定性下乐观原则的策略收集轨迹。
- UCBZero 使用一种仅依赖访问次数、不依赖奖励值的 Hoeffding 类型奖励增量,使其适用于与任务无关的设置。
- 探索完成后,通过为每个任务在收集的轨迹上附加采样奖励,计算 N 个任务的近似最优策略。
- 该算法确保所有状态-动作对都得到充分访问,从而支持从收集的转移数据中准确估计动态模型。
- 理论分析结合 Azuma-Hoeffding 偏差不等式与模拟引理论证,推导出依赖于 N 和不依赖于 N 的边界。
- 建立了 $\Omega(\log(N)H^2SA/\varepsilon^2)$ 的下界,证明了在与任务无关设置中 $\log(N)$ 缩放的必要性。
实验结果
研究问题
- RQ1在学习阶段未预设任何奖励函数时,能否在强化学习中实现高效探索?
- RQ2是否可能仅通过一次无奖励探索阶段,就为 $N$ 个任意任务学习到近似最优策略?
- RQ3与任务无关强化学习的根本样本复杂度极限是什么?其随任务数 $N$ 的变化规律如何?
- RQ4与任务特定和无奖励强化学习设置相比,与任务无关强化学习的统计难度有何不同?
- RQ5当已知真实奖励时,能否在与任务无关设置中实现不依赖于 $N$ 的样本复杂度边界?
主要发现
- UCBZero 在无奖励探索后,为 $N$ 个任务寻找 $\varepsilon$-最优策略的样本复杂度为 $\tilde{O}(\log(N)H^5SA/\varepsilon^2)$。
- 该算法性能接近最优,因为存在匹配的下界 $\Omega(\log(N)H^2SA/\varepsilon^2)$。
- UCBZero 确保所有状态-动作对均被充分访问,从而支持从收集的轨迹中准确估计动态模型。
- 该算法的 Hoeffding 类型奖励增量(仅依赖访问次数)对于实现与任务无关的探索至关重要。
- 在已知真实奖励的统计更简单设置中,UCBZero 实现了不依赖于 $N$ 的样本复杂度边界 $\tilde{O}(H^6S^2A^2(\log(3H/\varepsilon)+\iota)/\varepsilon^2)$。
- 理论分析揭示出严格的统计难度层级:任务特定 RL < 无奖励 RL < 与任务无关 RL,其中后者因探索阶段缺乏奖励引导而必须引入 $\log(N)$ 缩放。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。