Skip to main content
QUICK REVIEW

[论文解读] Randomized Entity-wise Factorization for Multi-Agent Reinforcement Learning

Shariq Iqbal, Christian A. Schroeder de Witt|arXiv (Cornell University)|Jun 7, 2020
Reinforcement Learning in Robotics参考文献 48被引用 15
一句话总结

本文提出了一种随机实体因子分解想象学习方法(REFIL),通过在随机采样的代理与实体子组上训练价值函数以实现效用分解,从而提升多任务多智能体强化学习的性能。通过想象部分观测并学习跨任务的共享模式,REFIL增强了泛化能力,在团队构成可变的复杂《星际争霸》微操环境中优于强基线模型。

ABSTRACT

Multi-agent settings in the real world often involve tasks with varying types and quantities of agents and non-agent entities; however, common patterns of behavior often emerge among these agents/entities. Our method aims to leverage these commonalities by asking the question: ``What is the expected utility of each agent when only considering a randomly selected sub-group of its observed entities?'' By posing this counterfactual question, we can recognize state-action trajectories within sub-groups of entities that we may have encountered in another task and use what we learned in that task to inform our prediction in the current one. We then reconstruct a prediction of the full returns as a combination of factors considering these disjoint groups of entities and train this ``randomly factorized" value function as an auxiliary objective for value-based multi-agent reinforcement learning. By doing so, our model can recognize and leverage similarities across tasks to improve learning efficiency in a multi-task setting. Our approach, Randomized Entity-wise Factorization for Imagined Learning (REFIL), outperforms all strong baselines by a significant margin in challenging multi-task StarCraft micromanagement settings.

研究动机与目标

  • 解决在代理与实体数量和类型可变的多智能体强化学习(MARL)中学习可泛化策略的挑战。
  • 通过识别代理子组中的共同行为模式,实现在不同团队构成的任务间的知识迁移。
  • 在不依赖任务结构先验知识或固定分组的前提下,提升协作式MARL的学习效率与泛化能力。
  • 开发一种训练范式,通过辅助价值函数因子化目标,利用任务间的共享结构模式。

提出的方法

  • 在训练过程中随机将观测到的实体划分为互不相交的子组,以模拟部分观测。
  • 训练一个价值函数以预测这些想象子组场景下的效用,从而促使模型从子结构(如足球中的‘突破’或《星际争霸》中的单位阵型)中学习可重用的模式。
  • 通过将想象的子组因子与考虑外部影响的交互项相结合,重构完整回报。
  • 采用基于注意力的模型与可学习掩码,高效实现基于实体的因子分解。
  • 将因子化价值函数作为辅助目标与主价值函数损失一同训练,保持模型表达能力的同时促进知识共享。
  • 该方法不要求子组相互独立或最优,允许从任务间任何重复出现的子结构中学习。

实验结果

研究问题

  • RQ1对实体进行随机子组因子分解是否能提升多任务多智能体强化学习中的泛化能力?
  • RQ2通过想象的部分观测进行学习,在捕捉多样化团队构成间可重用行为模式方面有多高效?
  • RQ3在复杂协作式MARL环境中,对随机采样实体子组进行效用因子化处理的价值函数能在多大程度上提升性能?
  • RQ4所提出的辅助训练目标是否能在不牺牲模型表达能力的前提下提升学习效率与可迁移性?

主要发现

  • REFIL在具有可变团队构成的挑战性多任务《星际争霸》微操环境中显著优于所有强基线模型。
  • 通过从随机采样的代理与实体子组中学习共享模式,该方法在多样化任务中实现了更好的泛化能力。
  • 辅助因子化目标提升了学习效率,实现了更快的收敛速度与更优的样本复杂度。
  • 即使子组并非完全独立,该方法仍能有效泛化,表现出对非最优采样策略的鲁棒性。
  • 基于注意力的掩码机制使得在可变大小输入设置下高效实现基于实体的因子分解成为可能。
  • 实证结果表明,模型可通过识别重复出现的子结构模式,将知识从简单团队配置迁移到更复杂的配置。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。