[论文解读] Hybrid Reward Architecture for Reinforcement Learning
本文提出混合奖励架构(Hybrid Reward Architecture,HRA),将环境奖励分解为多个组成部分,并为每个部分学习独立的价值函数,然后将它们聚合以在如 Ms. Pac-Man 等复杂领域中改进学习,达到超越人类的表现。
One of the main challenges in reinforcement learning (RL) is generalisation. In typical deep RL methods this is achieved by approximating the optimal value function with a low-dimensional representation using a deep network. While this approach works well in many domains, in domains where the optimal value function cannot easily be reduced to a low-dimensional representation, learning can be very slow and unstable. This paper contributes towards tackling such challenging domains, by proposing a new method, called Hybrid Reward Architecture (HRA). HRA takes as input a decomposed reward function and learns a separate value function for each component reward function. Because each component typically only depends on a subset of all features, the corresponding value function can be approximated more easily by a low-dimensional representation, enabling more effective learning. We demonstrate HRA on a toy-problem and the Atari game Ms. Pac-Man, where HRA achieves above-human performance.
研究动机与目标
- 在高复杂度的强化学习领域中激发学习,在这些领域中最优价值函数很难用低维表示来近似。
- 提出将环境奖励分解为由独立代理(头)学习的多个组成奖励。
- 证明聚合组成价值函数可以产生优于单头基线的策略并实现更快的学习。
提出的方法
- 将环境奖励 R_env 分解为 n 个组成奖励 R_k(s,a,s'),其中 k=1..n(Eq. 4)。
- 为每个组成奖励训练一个独立的强化学习代理,共享一个网络,但有多个头部表示 Q_k(s,a;θ)。
- 聚合头部以形成 Q_HRA(s,a;θ) = sum_k Q_k(s,a;θ)(Eq. 5)。
- 用各自的目标 y_k,i = R_k(s,a,s') + γ max_a' Q_k(s',a';θ_{i-1})(Eq. 7)更新每个头部。
- 探索训练目标:Q_env*(默认,一致)与 Q_HRA^ν(半一致,通过带随机策略的期望 SARSA 学习得到)(Eq. 8)。
- 可选地结合领域知识(特征过滤、终止状态处理、伪奖励等)以提升学习效率(Section 3.2)。
实验结果
研究问题
- RQ1将环境奖励分解为多个更简单的组成部分并学习独立的价值函数,是否能在困难的强化学习领域加速学习?
- RQ2将组成价值函数聚合是否能产生与标准单头方法相比具有竞争力或更优的策略?
- RQ3HRA 在玩具任务和具有挑战性的 Atari 游戏(如 Ms. Pac-Man),包括引入领域知识时的表现如何?
- RQ4哪些训练目标(Q_env* vs. Q_HRA^ν)在引导学习方面最有效?
- RQ5领域知识如何进一步提升 HRA 的性能?
主要发现
- HRA 在水果收集任务和 Ms. Pac-Man 上优于 DQN 基线,特别是在利用领域知识时。
- 使用 Q_HRA^ν(基于随机策略的目标)可以提供一个半一致的训练目标,有助于在导航型领域的学习。
- 在水果任务中,加入领域知识(去除无关特征、识别终止状态、使用伪奖励)可带来显著性能提升,表格表示实现近似最优行为。
- 在 Ms. Pac-Man 上,带有奖励分解和 GVFs 的 HRA 在固定起始和随机起始评估下的分数显著高于 A3C 基线和人类基准,甚至超越人类最高分并在具备执行记忆启发的增强下达到非常高的最大分数。
- HRA 通过为每个头创建大量具有小状态空间的 GVFs(GVF 状态空间约为 10^3/头)实现扩展,在单一紧凑表示难以学习的地方(如 Ms. Pac-Man)实现有效学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。