Skip to main content
QUICK REVIEW

[论文解读] UneVEn: Universal Value Exploration for Multi-Agent Reinforcement Learning

Tarun Gupta, Anuj Mahajan|arXiv (Cornell University)|Oct 6, 2020
Reinforcement Learning in Robotics参考文献 61被引用 7
一句话总结

UneVEn 提出了一种新颖的多智能体强化学习方法,通过利用相关且更简单的任务的策略,采用多智能体通用后续特征(MAUSFs)隐式地将探索偏向最优联合动作,从而缓解基于价值函数的多智能体强化学习中的相对过度泛化问题。通过在训练过程中采样并执行这些相关任务,UneVEn 克服了基于价值函数的多智能体强化学习中的相对过度泛化问题,实现了在协作密集型任务上的最先进性能,而 VDN 和 QMIX 在此类任务中会失效。

ABSTRACT

VDN and QMIX are two popular value-based algorithms for cooperative MARL that learn a centralized action value function as a monotonic mixing of per-agent utilities. While this enables easy decentralization of the learned policy, the restricted joint action value function can prevent them from solving tasks that require significant coordination between agents at a given timestep. We show that this problem can be overcome by improving the joint exploration of all agents during training. Specifically, we propose a novel MARL approach called Universal Value Exploration (UneVEn) that learns a set of related tasks simultaneously with a linear decomposition of universal successor features. With the policies of already solved related tasks, the joint exploration process of all agents can be improved to help them achieve better coordination. Empirical results on a set of exploration games, challenging cooperative predator-prey tasks requiring significant coordination among agents, and StarCraft II micromanagement benchmarks show that UneVEn can solve tasks where other state-of-the-art MARL methods fail.

研究动机与目标

  • 为解决基于价值函数的多智能体强化学习(MARL)中的相对过度泛化(RO)问题,即由于单调的价值分解导致最优联合动作被低估。
  • 通过利用不遭受 RO 的相关且更简单的任务的策略,改善合作型 MARL 中的联合探索。
  • 通过隐式加权探索以偏向高价值联合动作,实现在需要紧密时间协调的复杂多智能体任务中的有效协作。
  • 通过 VDN 风格的分解方式,将通用后续特征(USFs)扩展至多智能体场景,实现去中心化策略执行。

提出的方法

  • 提出多智能体通用后续特征(MAUSFs),采用 VDN 风格的单调分解方式,在智能体之间线性分解后续特征。
  • 在一系列相关任务的分布上学习后续特征的共享表示,从而实现从更简单任务向目标任务的知识迁移。
  • 在训练过程中,从以目标任务为中心的高斯分布中采样任务描述,并执行价值最高的任务,从而有效引导探索朝向高价值联合动作。
  • 利用已解决的相关任务的策略,隐式地偏向探索,降低因 RO 导致次优动作选择的可能性。
  • 采用集中式评论器,通过通用后续特征的线性组合来估计跨任务的联合价值函数。
  • 通过个体全局最大值(IGM)原则实现去中心化执行,确保可扩展性并兼容现有 MARL 框架。

实验结果

研究问题

  • RQ1同时学习相关任务是否能改善联合探索并克服合作型 MARL 中的相对过度泛化?
  • RQ2使用更简单相关任务的策略是否能隐式引导探索,使其趋向目标任务中的最优联合动作?
  • RQ3结合 VDN 分解的 MAUSFs 是否能在需要紧密时间协调的多智能体环境中实现有效协作?
  • RQ4UneVEn 在具有强相对过度泛化问题的任务中,与 SOTA 基于价值函数的 MARL 方法(如 VDN、QMIX 和 QTRAN)相比表现如何?
  • RQ5UneVEn 在相同环境中对新奖励函数的零样本泛化能力有多强?

主要发现

  • UneVEn 有效解决了 VDN 和 QMIX 因相对过度泛化而失效的需要紧密协调的捕食者-猎物任务。
  • 在对单独行动施加高惩罚的环境中(例如,p > r),UneVEn 保持了有效的探索与策略学习,而 VDN 和 QMIX 显著退化。
  • 该方法在 StarCraft II 微操控基准测试中实现了显著的性能提升,优于最先进的基于价值函数的 MARL 算法。
  • UneVEn 展现出强大的零样本泛化能力,适用于新奖励函数,表明通过 MAUSFs 实现了稳健的迁移学习。
  • 实证结果表明,UneVEn 通过利用相关任务,逐步扩大可解任务集合,最终将目标任务纳入可解集合。
  • 从以目标任务为中心的高斯分布中采样任务,能有效偏向探索至最优联合动作,从而在实践中减轻相对过度泛化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。