Skip to main content
QUICK REVIEW

[论文解读] Agent Modelling under Partial Observability for Deep Reinforcement Learning

Georgios Papoudakis, Filippos Christianos|arXiv (Cornell University)|Jun 16, 2020
Reinforcement Learning in Robotics被引用 13
一句话总结

本文提出局部信息代理建模(LIAM),一种深度强化学习方法,使智能体仅通过自身局部观测和动作即可推断其他智能体的行为,而无需直接访问其他智能体的轨迹。通过训练编码器-解码器网络,从受控智能体的局部数据中重建被建模智能体的观测和动作,LIAM在合作性、竞争性和混合型多智能体环境中均提升了策略性能,其性能与具备完全可观测性的基线方法相当。

ABSTRACT

Modelling the behaviours of other agents is essential for understanding how agents interact and making effective decisions. Existing methods for agent modelling commonly assume knowledge of the local observations and chosen actions of the modelled agents during execution. To eliminate this assumption, we extract representations from the local information of the controlled agent using encoder-decoder architectures. Using the observations and actions of the modelled agents during training, our models learn to extract representations about the modelled agents conditioned only on the local observations of the controlled agent. The representations are used to augment the controlled agent's decision policy which is trained via deep reinforcement learning; thus, during execution, the policy does not require access to other agents' information. We provide a comprehensive evaluation and ablations studies in cooperative, competitive and mixed multi-agent environments, showing that our method achieves higher returns than baseline methods which do not use the learned representations.

研究动机与目标

  • 为解决现有智能体建模方法在推理过程中假设可访问其他智能体观测和动作的局限性。
  • 在智能体感知和通信能力有限的局部可观测环境中,实现有效的智能体建模。
  • 开发一种仅从受控智能体的局部观测和动作中学习其他智能体行为表示的方法。
  • 通过深度强化学习(如A2C)将这些学习到的表示集成到受控智能体的决策策略中。
  • 在包括合作性、竞争性和混合型在内的多样化多智能体环境中评估该方法。

提出的方法

  • 该方法使用编码器-解码器架构,从受控智能体的局部观测和动作中学习被建模智能体轨迹的紧凑表示。
  • 训练期间,解码器利用编码表示重建被建模智能体的观测和动作,编码器则通过最小化重建误差进行训练。
  • 训练完成后,仅保留编码器,用于基于受控智能体的局部状态和动作历史生成表示。
  • 这些表示用于条件化受控智能体的策略,该策略与智能体模型通过深度强化学习(如A2C)联合训练。
  • 模型训练使用重建损失,不采用变分下界,避免了β-VAE或MMD正则化带来的复杂性。
  • 该方法在三个环境中进行了评估:双说话者-听者环境、基于层级的觅食环境,以及修改后的捕食者-猎物游戏。

实验结果

研究问题

  • RQ1在推理过程中,仅使用受控智能体的本地信息是否能实现有效的智能体建模?
  • RQ2基于本地观测的智能体建模方法与假设可完全观测其他智能体轨迹的方法相比表现如何?
  • RQ3学习到的表示能否提升受控智能体在合作性、竞争性和混合型多智能体环境中的性能?
  • RQ4编码器表示质量对下游策略性能有何影响?
  • RQ5当被建模智能体不响应受控智能体动作时,该方法的鲁棒性如何?

主要发现

  • 与不使用智能体建模的基线方法相比,LIAM在多智能体环境中显著提升了回合回报。
  • 在某些环境中,使用LIAM的A2C方法所获得的平均回报几乎与理想基线(FIAM)相当,后者在推理时可访问被建模智能体的完整轨迹。
  • 在双说话者-听者环境中,该方法成功通过观察被建模智能体对不同消息的反应,推断出受控智能体自身的颜色。
  • 解码器对受控智能体颜色的重建随时间演变:初期不确定性较高(值约0.3),在t=7时开始向蓝色偏移,随后在观察到不一致响应后更正为红色。
  • 该方法在合作性、竞争性和混合型环境中均表现良好,展现出超越特定任务类型的泛化能力。
  • 当被建模智能体不响应受控智能体动作时,LIAM失效,因为缺乏可用于推断被建模智能体轨迹的信息。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。