[论文解读] Learning Nearly Decomposable Value Functions Via Communication Minimization
NDQ 在尽量减少通信的前提下学习几乎可分解的Q函数,使智能体在大体上可独立行动,同时有选择地交换简短信息,在星际争霸 II 任务中将通信量降低超过80%,且性能不受损。
Reinforcement learning encounters major challenges in multi-agent settings, such as scalability and non-stationarity. Recently, value function factorization learning emerges as a promising way to address these challenges in collaborative multi-agent systems. However, existing methods have been focusing on learning fully decentralized value functions, which are not efficient for tasks requiring communication. To address this limitation, this paper presents a novel framework for learning nearly decomposable Q-functions (NDQ) via communication minimization, with which agents act on their own most of the time but occasionally send messages to other agents in order for effective coordination. This framework hybridizes value function factorization learning and communication learning by introducing two information-theoretic regularizers. These regularizers are maximizing mutual information between agents' action selection and communication messages while minimizing the entropy of messages between agents. We show how to optimize these regularizers in a way that is easily integrated with existing value function factorization methods such as QMIX. Finally, we demonstrate that, on the StarCraft unit micromanagement benchmark, our framework significantly outperforms baseline methods and allows us to cut off more than $80\\%$ of communication without sacrificing the performance. The videos of our experiments are available at https://sites.google.com/view/ndq.
研究动机与目标
- 解决集中训练、分散执行下多智能体强化学习中的错配协同和可扩展性问题。
- 引入具有可学习通信的几乎可分解的Q函数(NDQ),在需要时进行协同。
- 开发信息理论正则化项,在最大化表达性通信的同时最小化信息熵。
- 在可扩展的训练框架中,将NDQ与现有的值分解方法(如QMIX)集成。
提出的方法
- 学习以本地历史和来自其他智能体的选择性消息为条件的去中心化Q函数。
- 使用一个随机消息嵌入空间,其中消息来自由编码器参数化的分布,便于变分优化。
- 最大化其他智能体的行动与消息之间的互信息,以确保通信的表达性。
- 最小化消息的熵(或变异性),以通过基于KL散度的界限确保简短通信。
- 推导可处理的变分下界并与TD损失整合,实现端到端训练所有组件。
- 通过对潜在消息均值进行阈值处理,实现按比特级别的截断,在执行阶段剔除无意义的通信。
实验结果
研究问题
- RQ1在几乎可分解的Q函数和最小通信条件下,是否能比完全去中心化的分解方法提高协同?
- RQ2如何设计信息理论正则化项以学习何时进行通信以及发送何种信息?
- RQ3在部分消息被丢弃时,通信正则化对性能和鲁棒性的影响如何?
- RQ4在如星际争霸 II 单位微操等具有挑战性的多智能体强化学习基准上,NDQ 与 QMIX 和 TarMAC 的比较如何?
主要发现
- 在标准条件下,NDQ 显著优于基线分解方法在星际争霸 II 单位微操任务。
- NDQ 在星际争霸 II 情景中可将通信量减少超过80%且不牺牲性能。
- 智能体学习以最小的信息进行协调,有时只需一两比特即可实现有效协调。
- NDQ 超越如 QMIX+TarMAC 这样的注意力通信基线,并学习出简洁而表达力强的消息嵌入。
- 当80%的消息被丢弃时,NDQ 仍保持竞争性表现,证明对通信下降的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。