Skip to main content
QUICK REVIEW

[论文解读] Policy Regularization via Noisy Advantage Values for Cooperative Multi-agent Actor-Critic methods

Jian Hu, Siyue Hu|arXiv (Cornell University)|Jun 27, 2021
Optimization and Search Problems被引用 8
一句话总结

该论文提出 Noisy-Value MAPPO (NV-MAPPO) 和 Noisy-Advantage MAPPO (NA-MAPPO),通过分别向价值函数和优势函数中注入高斯噪声来正则化多智能体策略,以缓解合作式多智能体强化学习中的策略过拟合问题。该方法在无需智能体特异性特征的情况下,在 SMAC 上实现了最先进性能,硬性场景下的胜率最高达到 97%。

ABSTRACT

Recent works have applied the Proximal Policy Optimization (PPO) to the multi-agent cooperative tasks, such as Independent PPO (IPPO); and vanilla Multi-agent PPO (MAPPO) which has a centralized value function. However, previous literature shows that MAPPO may not perform as well as Independent PPO (IPPO) and the Fine-tuned QMIX on Starcraft Multi-Agent Challenge (SMAC). MAPPO-Feature-Pruned (MAPPO-FP) improves the performance of MAPPO by the carefully designed agent-specific features, which may be not friendly to algorithmic utility. By contrast, we find that MAPPO may face the problem of extit{The Policies Overfitting in Multi-agent Cooperation(POMAC)}, as they learn policies by the sampled advantage values. Then POMAC may lead to updating the multi-agent policies in a suboptimal direction and prevent the agents from exploring better trajectories. In this paper, to mitigate the multi-agent policies overfitting, we propose a novel policy regularization method, which disturbs the advantage values via random Gaussian noise. The experimental results show that our method outperforms the Fine-tuned QMIX, MAPPO-FP, and achieves SOTA on SMAC without agent-specific features. We open-source the code at \url{https://github.com/hijkzzz/noisy-mappo}.

研究动机与目标

  • 为解决多智能体合作式强化学习中,特别是 MAPPO 中策略对采样优势值过拟合的问题。
  • 通过在优势函数和价值函数中引入噪声,提升多智能体演员-评论家方法的泛化能力和探索性能。
  • 在不依赖手工设计的智能体特异性特征的情况下,于 StarCraft Multi-Agent Challenge (SMAC) 基准上实现最先进性能。
  • 证明在优势函数中注入噪声是一种简单但有效的正则化策略,优于特征工程方法和单调性约束模型。

提出的方法

  • 提出 Noisy-Value MAPPO (NV-MAPPO),在训练过程中向集中式价值函数注入独立的高斯噪声,以正则化策略更新。
  • 引入 Noisy-Advantage MAPPO (NA-MAPPO),将噪声直接注入用于策略优化的优势值中。
  • 采用相同的 MAPPO 框架,但通过使用独立同分布的高斯噪声扰动价值函数或优势函数,修改优势估计过程。
  • 在策略和价值函数更新过程中均应用噪声,噪声调度设计用于稳定学习同时促进探索。
  • 采用集中训练、去中心化执行 (CTDE) 框架,保持原始 MAPPO 架构的同时引入基于噪声的正则化。
  • 噪声按每集每智能体应用,确保策略梯度信号的随机性,防止对特定优势估计的过拟合。

实验结果

研究问题

  • RQ1在合作式多智能体强化学习中,向优势函数或价值函数中注入噪声是否能缓解策略过拟合?
  • RQ2基于噪声的正则化是否在性能和算法简洁性方面优于特征工程方法(如 MAPPO-FP)?
  • RQ3一种简单的噪声注入方法是否能在不依赖智能体特异性特征或单调性约束的情况下实现 SMAC 上的最先进结果?
  • RQ4价值函数或优势函数中的噪声如何影响多智能体设置下的策略熵和探索动态?
  • RQ5所提出的方法是否能在 QMIX 因单调性约束而失效的非单调环境中实现泛化?

主要发现

  • NV-MAPPO 在所有硬性 SMAC 场景中实现了 97% 的平均胜率,优于微调后的 QMIX 和 MAPPO-FP。
  • 该方法在无需使用智能体特异性特征的情况下实现了 SMAC 上的最先进性能,证明了其卓越的算法实用性。
  • NA-MAPPO 在不同场景中表现出较高的性能方差,表明优势值中的噪声可能使学习过程不稳定,尽管其仍优于原始 MAPPO。
  • NV-MAPPO 显著改善了策略熵的动力学,防止了过早收敛到次优策略,这一点在 3s5z_vs_3s6z 场景中得到验证。
  • 在价值函数估计方差较高的场景(如 3s5z_vs_3s6z)中,NV-MAPPO 的性能提升最大,证实了噪声引起的正则化与性能提升之间的关联。
  • 在非单调矩阵博弈中,NV-MAPPO 表现优于 QMIX,表明该方法在 QMIX 因单调性约束而失效的环境中依然有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。