[论文解读] Reward Tweaking: Maximizing the Total Reward While Planning for Short Horizons
本文提出奖励微调(reward tweaking)方法,通过学习一个代理奖励函数,使强化学习智能体即使在使用短时 horizon 折扣目标进行训练时,也能在有限 horizon 总奖励任务上实现最优性能。通过将奖励学习建模为轨迹之间的最大间隔分类问题,该方法在所有可行的折扣因子下均提升了性能,包括 γ=0.99,平均使 Hopper-v2 环境性能提升 +6%。
In reinforcement learning, the discount factor $γ$ controls the agent's effective planning horizon. Traditionally, this parameter was considered part of the MDP; however, as deep reinforcement learning algorithms tend to become unstable when the effective planning horizon is long, recent works refer to $γ$ as a hyper-parameter -- thus changing the underlying MDP and potentially leading the agent towards sub-optimal behavior on the original task. In this work, we introduce \emph{reward tweaking}. Reward tweaking learns a surrogate reward function $ ilde r$ for the discounted setting that induces optimal behavior on the original finite-horizon total reward task. Theoretically, we show that there exists a surrogate reward that leads to optimality in the original task and discuss the robustness of our approach. Additionally, we perform experiments in high-dimensional continuous control tasks and show that reward tweaking guides the agent towards better long-horizon returns although it plans for short horizons.
研究动机与目标
- 解决强化学习中训练使用折扣目标与评估使用未折扣总奖励之间的差距。
- 缓解因折扣因子过低导致规划 horizon 不足而引发的次优行为(Blackwell 次优性)。
- 使在 γ-折扣目标下训练的智能体仍能在原始有限 horizon 总奖励任务上实现最优行为。
- 设计一种方法,学习一个代理奖励函数,既保留原始任务的最优性,又能与标准强化学习算法兼容。
- 提升高维连续控制任务中的样本效率与性能,这些任务因折扣因子选择不佳而使标准算法失效。
提出的方法
- 该方法学习一个代理奖励函数 $\tilde{r}$,当其在 γ-折扣目标下进行优化时,能产生针对原始总奖励目标最优的策略。
- 将奖励学习建模为监督分类问题,具体为在高回报与低回报轨迹之间寻找最大间隔分离器。
- 使用从环境中采样的部分轨迹训练代理奖励,损失函数基于完整轨迹段计算,以捕捉长期回报差异。
- 理论上证明了存在一种代理奖励,可在原始任务目标下诱导出最优行为。
- 该方法在表格设置和高维连续控制设置(包括 Hopper-v2 环境)中进行了评估。
- 代理奖励通过离线经验进行训练,支持在无需额外环境交互的情况下重复用于多个策略训练过程。
实验结果
研究问题
- RQ1能否学习到一种代理奖励函数,使得在 γ-折扣目标下优化该函数,可实现原始有限 horizon 总奖励任务上的最优行为?
- RQ2在 Blackwell 次优性区域(γ < 0.99)中,奖励微调在不同折扣因子下的表现如何,尤其是在低 γ 值下?
- RQ3该方法能否在 Hopper-v2 等高维连续控制任务中提升性能,这些任务因不稳定或规划 horizon 短暂而使标准算法难以奏效?
- RQ4与基线方法相比,奖励学习的最大间隔公式是否能生成更鲁棒、更具泛化能力的代理奖励?
- RQ5奖励微调在多大程度上缩小了折扣训练目标与未折扣评估指标之间的性能差距?
主要发现
- 在 Hopper-v2 环境中,奖励微调使平均性能提升约 6%,在 γ=0.99 时回报从 ~3200 提升至 ~3400。
- 该方法在所有可行的折扣因子(γ ≤ 0.99)下均表现更优,尤其有效缓解了因规划 horizon 短暂导致的次优性。
- 随着 γ 降低,性能方差增大,表明在更短 horizon 下学习代理奖励更具挑战性。
- 在表格设置中,学习到的代理奖励展现出密集且信息丰富的信号,便于强化学习算法学习,可视化结果已证实这一点。
- 奖励微调使智能体即使在训练目标使用次优折扣因子时,也能在原始总奖励任务上实现最优行为。
- 该方法无法解决高 γ 值(>0.99)下的训练不稳定性,但有效解决了低 γ 范围内更普遍存在的 Blackwell 次优性问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。