[论文解读] Learning Novel Policies For Tasks
本文提出任务-新颖性平分器(TNB),一种强化学习方法,通过在任务奖励与新颖性奖励之间取得平衡,为给定任务发现多样化且高性能的策略。利用自编码器衡量与先前学习策略的行为差异,TNB 采用梯度平分法同时提升任务性能与策略多样性,在迷宫导航、机器人控制和欺骗性任务中均优于随机重初始化和加权和方法。
In this work, we present a reinforcement learning algorithm that can find a variety of policies (novel policies) for a task that is given by a task reward function. Our method does this by creating a second reward function that recognizes previously seen state sequences and rewards those by novelty, which is measured using autoencoders that have been trained on state sequences from previously discovered policies. We present a two-objective update technique for policy gradient algorithms in which each update of the policy is a compromise between improving the task reward and improving the novelty reward. Using this method, we end up with a collection of policies that solves a given task as well as carrying out action sequences that are distinct from one another. We demonstrate this method on maze navigation tasks, a reaching task for a simulated robot arm, and a locomotion task for a hopper. We also demonstrate the effectiveness of our approach on deceptive tasks in which policy gradient methods often get stuck.
研究动机与目标
- 解决标准强化学习算法通常仅找到单一策略的问题,即使存在多个不同的解决方案。
- 在无需手动奖励工程或随机种子调优的情况下,实现对给定任务的多个多样化且高效策略的发现。
- 开发一种方法,在保持高任务性能的同时,鼓励探索不同的行为模式。
- 在标准策略梯度方法常陷入局部最优的欺骗性环境中,提升样本效率与鲁棒性。
- 提供一种可推广的框架,适用于任何策略梯度算法(如PPO),用于发现新型策略。
提出的方法
- 在先前发现的策略的状态序列上训练自编码器,以学习典型行为的紧凑表征。
- 利用自编码器的重构误差定义新颖性奖励函数,对与过往策略相似的行为施加惩罚。
- 将多目标强化学习问题表述为两个目标:最大化任务奖励与最大化新颖性奖励。
- 应用梯度平分法,以平衡且非加权的方式结合任务奖励与新颖性奖励的策略梯度。
- 使用所得的组合梯度更新策略网络,确保在不损害任务性能的前提下同时推进两个目标。
- 以PPO作为基础强化学习算法应用该方法,但可扩展至其他策略梯度方法(如SAC或TRPO)。
实验结果
研究问题
- RQ1强化学习算法是否能在无需手动奖励塑造的情况下,为单一任务发现多个不同且高性能的策略?
- RQ2如何有效衡量并激励行为新颖性,同时保持任务性能?
- RQ3基于梯度的多目标方法是否优于随机重初始化或加权和奖励组合方法,在发现多样化策略方面表现更优?
- RQ4该方法是否能成功应对标准强化学习算法易陷入局部极小值的欺骗性环境?
- RQ5基于自编码器重构误差的新颖性信号,在策略多样性与任务成功率方面,与其它内在好奇心或选项发现方法相比表现如何?
主要发现
- 任务-新颖性平分器(TNB)在所有五个测试任务(迷宫导航、机械臂抓取、Hopper运动控制,以及两个欺骗性变体)中成功发现了新型策略,且无需调整奖励函数。
- 在欺骗性迷宫和欺骗性抓取任务中,TNB成功获得了4/5个有效策略,而标准PPO和SAC则完全失败。
- 加权和奖励(WSR)方法需要仔细调优新颖性与任务奖励的比率,且在权重不理想时经常失败。
- TNB优于随机种子重初始化,在多个不同种子的运行中均能持续发现不同的策略,而即使多次尝试不同种子,仍可能无法产生多样性。
- 基于自编码器的新颖性信号有效捕捉了行为差异,使算法能够避免重复先前发现的策略模式。
- 该方法在多种环境中表现出鲁棒性,包括连续控制任务和具有误导性局部最优的复杂欺骗性任务。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。