Skip to main content
QUICK REVIEW

[论文解读] Action Guidance: Getting the Best of Sparse Rewards and Shaped Rewards for Real-time Strategy Games

Shengyi Huang, Santiago Ontañón|arXiv (Cornell University)|Oct 5, 2020
Reinforcement Learning in Robotics参考文献 30被引用 5
一句话总结

本文提出动作引导(action guidance),一种新颖的强化学习方法,结合了奖励塑形以提升样本效率,同时利用稀疏奖励确保真正目标的优化。通过在稀疏奖励上训练主智能体,同时使用在塑形奖励上训练的辅助智能体来引导探索,该方法在保持与奖励塑形相当的样本效率的同时,确保主智能体最终优化真实目标,该方法在μRTS环境中得到验证。

ABSTRACT

Training agents using Reinforcement Learning in games with sparse rewards is a challenging problem, since large amounts of exploration are required to retrieve even the first reward. To tackle this problem, a common approach is to use reward shaping to help exploration. However, an important drawback of reward shaping is that agents sometimes learn to optimize the shaped reward instead of the true objective. In this paper, we present a novel technique that we call action guidance that successfully trains agents to eventually optimize the true objective in games with sparse rewards while maintaining most of the sample efficiency that comes with reward shaping. We evaluate our approach in a simplified real-time strategy (RTS) game simulator called $μ$RTS.

研究动机与目标

  • 解决实时战略(RTS)游戏中稀疏奖励带来的挑战,其中探索效率低下且信用分配困难。
  • 克服奖励塑形的缺点,即智能体可能优化塑形后的奖励而非真实目标。
  • 开发一种方法,在保持奖励塑形的样本效率的同时,确保主智能体学习优化真正的稀疏奖励。
  • 在真实但简化的RTS环境μRTS中,针对不同难度的任务评估该方法。

提出的方法

  • 该方法使用仅在稀疏奖励函数 $ R_{\mathcal{M}} $ 上训练的主智能体,确保与真实目标的一致性。
  • 辅助智能体在塑形奖励函数 $ R_{\mathcal{A}_i} $ 上进行训练,以在早期训练阶段提供样本高效的引导。
  • 在训练过程中,主智能体最初以高概率遵循从辅助智能体采样的动作,随后逐渐变得更加独立。
  • 主智能体与辅助智能体通过离策略策略梯度进行训练,共享轨迹以提高数据效率。
  • 动作引导结合了奖励塑形(用于辅助智能体)与模仿学习(用于主智能体引导),形成一种混合训练机制。
  • 通过调整适应期长度和是否使用PLO(正向学习优化)等超参数,平衡引导强度与策略偏差。

实验结果

研究问题

  • RQ1动作引导能否在实现与奖励塑形相当的样本效率的同时,确保主智能体优化真正的稀疏奖励?
  • RQ2适应期的长度如何影响主智能体发现有效行为的能力?
  • RQ3使用PLO是否能提升动作引导智能体的训练稳定性和收敛性?
  • RQ4动作引导能否在不访问塑形奖励的情况下,训练智能体学习高效且类人的策略(例如:工人突袭、单位并行生产)?
  • RQ5当辅助智能体也从主智能体的策略中获益时,动作引导是否依然可行,表明存在一种协作学习机制?

主要发现

  • 在μRTS的三个任务中,动作引导实现的样本效率几乎与奖励塑形完全一致,展现出强大的数据效率。
  • 使用动作引导训练的主智能体学会了以最快的速度赢得游戏,即使它从未见过塑形奖励,证实了对真实目标的真正优化。
  • 在DefeatRandomEnemy任务中,动作引导智能体始终学习到工人突袭策略——一种强大且高效的策略——而塑形奖励智能体则表现出多样但次优的行为。
  • 在ProduceCombatUnits任务中,采用长适应期的主智能体学会了并行生产战斗单位和采集资源——与专家行为一致——而塑形奖励智能体则延迟到资源完全收集后才开始单位生产。
  • PLO在短适应期设置下提升了收敛稳定性,但在长适应期设置下反而降低了性能,表明其效果具有上下文依赖性。
  • 动作引导的混合策略变体在各项任务中均表现出色,表明主智能体与辅助智能体之间存在双向知识迁移的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。