Skip to main content
QUICK REVIEW

[论文解读] Learning to Incentivize Other Learning Agents

Jiachen Yang, Ang Li|arXiv (Cornell University)|Jun 10, 2020
Reinforcement Learning in Robotics参考文献 42被引用 17
一句话总结

本文提出了一种名为 LIO(Learning to Incentivize Others)的方法,其中强化学习智能体学习向其他智能体提供奖励,以塑造其行为并提升整体表现。通过显式建模激励如何影响他人学习,从而影响自身表现,LIO 智能体在一般和博弈(general-sum Markov games)中实现了接近最优的合作,显著优于标准强化学习(RL)和对手塑造(opponent-shaping)基线方法,在 Escape Room 和 Cleanup 等环境中表现突出。

ABSTRACT

The challenge of developing powerful and general Reinforcement Learning (RL) agents has received increasing attention in recent years. Much of this effort has focused on the single-agent setting, in which an agent maximizes a predefined extrinsic reward function. However, a long-term question inevitably arises: how will such independent agents cooperate when they are continually learning and acting in a shared multi-agent environment? Observing that humans often provide incentives to influence others' behavior, we propose to equip each RL agent in a multi-agent environment with the ability to give rewards directly to other agents, using a learned incentive function. Each agent learns its own incentive function by explicitly accounting for its impact on the learning of recipients and, through them, the impact on its own extrinsic objective. We demonstrate in experiments that such agents significantly outperform standard RL and opponent-shaping agents in challenging general-sum Markov games, often by finding a near-optimal division of labor. Our work points toward more opportunities and challenges along the path to ensure the common good in a multi-agent future.

研究动机与目标

  • 解决在共享环境中,独立学习的强化学习智能体因目标不一致而难以合作的挑战。
  • 通过使智能体能够学习给予奖励以影响他人行为,克服固定奖励函数的局限性。
  • 开发一种方法,考虑激励对受激励者学习过程的长期影响,以及对智能体自身外在目标的影响。
  • 通过学习到的激励函数,使智能体能够发现合作任务中高效的分工方式。
  • 证明学习到的激励机制相较于标准强化学习和对手塑造方法,能带来更高的个体与集体表现。

提出的方法

  • 智能体学习一种激励函数,向其他学习型智能体提供奖励,显式建模这些激励对受激励者策略更新的影响。
  • 该方法推导出智能体外在目标相对于其激励函数参数的梯度,支持通过策略梯度方法进行端到端训练。
  • 通过使用独立的训练阶段,将激励更新与策略更新解耦,降低方差并提升学习稳定性。
  • 当激励更新与策略更新发生在同一阶段时,采用重要性采样校正方法,以减轻分布偏移问题。
  • 智能体通过策略梯度优化进行训练,激励函数与策略联合优化,以最大化智能体的总外在回报。
  • 该框架应用于 Escape Room 和 Cleanup 等一般和博弈(general-sum Markov games),其中智能体需协同以实现更高的集体回报。

实验结果

研究问题

  • RQ1智能体能否学习以一种方式向其他智能体提供奖励,从而通过间接影响他人学习,提升自身的长期外在表现?
  • RQ2在多智能体合作设置中,学习到的激励机制与标准独立强化学习和对手塑造方法相比表现如何?
  • RQ3智能体能否通过学习到的激励机制而非固定的奖励塑造,发现高效的分工方式?
  • RQ4将激励更新与策略更新解耦对学习稳定性与性能有何影响?
  • RQ5在复杂且不对称的环境中,通过激励塑造他人学习的能力,是否能带来更高的集体与个体回报?

主要发现

  • 在双智能体 Escape Room 游戏中,LIO 智能体实现了接近 9.0 的联合回报,达到全局最大值,而标准 PG 和 PG-rewards 智能体则被困在全局最小值。
  • LIO 超过了 LOLA 和 2-TS 方法,后者需要显著更多的训练步数,且收敛可靠性较低。
  • 在三智能体 Escape Room 游戏中,LIO 使一个智能体成为主要的奖励提供者,激励其他智能体拉动杠杆,从而实现成功合作。
  • 在 7x7 Cleanup 环境中,LIO 智能体学习到了稳定的分工:一个专注于收集苹果,另一个专注于清理垃圾,这种分工由收割者提供的激励驱动。
  • LIO 智能体获得的平均奖励高于 AC 智能体,后者在清理后争夺苹果,导致联合次优结果。
  • 在 10x10 地图上,LIO 智能体成功适应了预设的对手策略,展示了在动态环境中具备鲁棒性与适应性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。