[论文解读] What Can Learned Intrinsic Rewards Capture?
本文提出了一种可扩展的元梯度框架,用于学习能够捕捉跨多个智能体生命周期的长期探索与利用知识的内在奖励函数。通过训练循环神经网络以最大化生命周期回报,该方法学习到非平稳的内在奖励,这些奖励可泛化至新智能体、动作空间和学习算法——提供了一种与基于策略的'如何做'知识转移相区别的灵活的'该做什么'知识定位。
The objective of a reinforcement learning agent is to behave so as to maximise the sum of a suitable scalar function of state: the reward. These rewards are typically given and immutable. In this paper, we instead consider the proposition that the reward function itself can be a good locus of learned knowledge. To investigate this, we propose a scalable meta-gradient framework for learning useful intrinsic reward functions across multiple lifetimes of experience. Through several proof-of-concept experiments, we show that it is feasible to learn and capture knowledge about long-term exploration and exploitation into a reward function. Furthermore, we show that unlike policy transfer methods that capture "how" the agent should behave, the learned reward functions can generalise to other kinds of agents and to changes in the dynamics of the environment by capturing "what" the agent should strive to do.
研究动机与目标
- 探究内在奖励函数是否可作为捕捉强化学习中复杂、长期知识的可行定位。
- 解决学习有效、非平稳的内在奖励以在不同环境与智能体动态间泛化的挑战。
- 探索所学奖励是否可优于策略迁移,在泛化至新动作空间与学习算法方面表现更优。
- 证明内在奖励可编码比策略中编码的'如何做'知识更具适应性的'该做什么'知识。
提出的方法
- 采用多生命周期强化学习设置,其中智能体在每个回合开始时被重新初始化,并使用单一共享的内在奖励函数进行学习。
- 通过在智能体整个生命周期上展开的循环神经网络参数化内在奖励函数,以建模长期的时间依赖性。
- 使用生命周期价值函数估计剩余累积回报,实现对长序列经验的信用分配。
- 通过元梯度优化训练内在奖励,以最大化智能体在整个生命周期内的累积外在回报。
- 利用策略更新与奖励函数之间的可微交互,实现内在奖励的端到端训练。
- 将学习过程分解为策略(θ)与内在奖励(η)参数,实现'该做什么'知识的模块化迁移。
实验结果
研究问题
- RQ1所学的内在奖励是否能有效捕捉跨多个回合的长期探索与利用行为?
- RQ2内在奖励是否能泛化至具有不同动作空间或学习算法的新智能体,而不同于策略迁移方法?
- RQ3在样本效率与渐近性能方面,所学内在奖励与RL2和MAML等策略迁移方法相比表现如何?
- RQ4在非平稳环境中,内在奖励在多大程度上能捕捉与任务相关的规律性?
- RQ5当对任务分布有效时,所学奖励函数是否表现出与已知内在动机机制(如好奇心)类似的特性?
主要发现
- 所学的内在奖励函数成功捕捉了长期探索与利用行为,包括新颖性探索与对环境变化的预期。
- 该方法优于随机基线,并在渐近性能上与RL2相当,尽管从随机策略开始且依赖间接奖励引导。
- 内在奖励能有效泛化至动作空间经置换或扩展的新智能体,因为奖励基于状态变化而非动作。
- 所学的内在奖励可迁移至不同学习算法(如Q-learning),证明其鲁棒性及对底层策略更新机制的独立性。
- 与策略迁移方法(如RL2和MAML)相比,内在奖励方法在动作空间与学习算法变化时泛化表现更优,凸显了'该做什么'知识相对于'如何做'知识的优势。
- 该框架在任务分布有效时,能促使出现与任务无关的内在动机信号(如好奇心),表明其具备自适应潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。