Skip to main content
QUICK REVIEW

[论文解读] Options as responses: Grounding behavioural hierarchies in multi-agent RL

Alexander Sasha Vezhnevets, Yuhuai Wu|arXiv (Cornell University)|Jun 4, 2019
Reinforcement Learning in Robotics参考文献 40被引用 11
一句话总结

本文提出OPRE(Options as Responses),一种分层强化学习架构,通过学习对手隐藏策略的潜在表征,将战略决策建立在博弈论结构之上。通过将高层战略选择与低层策略执行分离,OPRE在非传递性多智能体博弈(如Running With Scissors和RPS Arena)中实现了对未见过对手的优越泛化能力,优于标准深度强化学习基线方法,后者在该类任务中无法实现泛化。

ABSTRACT

This paper investigates generalisation in multi-agent games, where the generality of the agent can be evaluated by playing against opponents it hasn't seen during training. We propose two new games with concealed information and complex, non-transitive reward structure (think rock/paper/scissors). It turns out that most current deep reinforcement learning methods fail to efficiently explore the strategy space, thus learning policies that generalise poorly to unseen opponents. We then propose a novel hierarchical agent architecture, where the hierarchy is grounded in the game-theoretic structure of the game -- the top level chooses strategic responses to opponents, while the low level implements them into policy over primitive actions. This grounding facilitates credit assignment across the levels of hierarchy. Our experiments show that the proposed hierarchical agent is capable of generalisation to unseen opponents, while conventional baselines fail to generalise whatsoever.

研究动机与目标

  • 解决多智能体强化学习中的泛化挑战,特别是针对训练期间未遇到过的对手。
  • 开发一种新型实验框架,利用两款新颖的网格世界游戏——Running With Scissors(RWS)和RPS Arena——其具有隐藏信息和非传递性奖励结构。
  • 探究为何标准深度强化学习方法在这些环境中仍无法实现泛化,尽管其设计初衷即为多智能体设置。
  • 提出一种分层智能体架构,将战略推理与战术执行分离,并基于环境的博弈论结构进行构建。
  • 证明所提出的架构能够实现优于标准基线的更好泛化能力以及更广泛的战略覆盖范围。

提出的方法

  • 引入两款部分可观测、空间扩展的多智能体游戏,具有非传递性收益(如石头剪刀布)以及对手策略的隐藏信息。
  • 对对手隐藏策略的潜在表征进行价值函数分解,实现在分层结构中的结构化信用分配。
  • 利用学习到的潜在空间将策略分解为离散选项,其中每个选项对应于对特定对手策略类型的响应。
  • 在顶层训练一个元策略,从自身观测中推断对手的潜在表征,并选择合适的选项。
  • 将底层选项实现为基于所选响应执行特定战术行为(如收集石头、标记对手、侦察)的策略。
  • 通过自博弈训练整个系统,确保智能体在推理过程中无法直接访问对手隐藏策略的情况下,仍能自适应地响应各类对手类型。

实验结果

研究问题

  • RQ1为何标准深度强化学习智能体在具有隐藏信息的非传递性多智能体博弈中,无法泛化到未见过的对手?
  • RQ2基于环境博弈论结构的分层强化学习架构,是否能超越训练阶段遇到的对手,实现更好的泛化能力?
  • RQ3所提出架构中学习到的选项是否对应于有意义且互异的低层行为,从而覆盖整个策略空间?
  • RQ4智能体群体的多样性(通过有效多样性衡量)与多智能体设置中的泛化性能之间有何关系?
  • RQ5能否从部分观测中有效推断出对手策略的潜在表征,并用于指导战略决策?

主要发现

  • 标准深度强化学习基线方法,包括MADQN、MAPPO和COMA,在RWS和RPS Arena环境中即使采用自博弈训练,也无法泛化到未见过的对手。
  • OPRE架构显著优于所有基线,在与未见过对手的直接对战以及完整智能体锦标赛中均表现出强大性能。
  • OPRE智能体展现出较高的有效多样性(RWS中为0.42),表明未出现单一主导策略,支持更广泛的战略覆盖和更好的泛化能力。
  • 神经分析确认,各个选项编码了不同且可解释的行为,如侦察、收集特定资源(石头、纸张、剪刀)以及标记对手。
  • 选项结构具有实际意义且无冗余:部分选项专门针对特定动作(如选项0收集剪刀,选项4引发标记),而其他选项则组合多种行为(如选项2同时执行侦察与收集纸张)。
  • 该架构成功地将战略(元策略)与战术(选项)层级解耦,使学习到的响应能够重新组合以应对不熟悉对手,这正是其泛化能力的根源。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。