[论文解读] Multi-Agent Policy Transfer via Task Relationship Modeling
本文提出 MATTAR,一种多智能体强化学习框架,通过基于影响的任务表征建模任务关系,实现在协作任务间高效策略迁移。通过使用超网络和交替固定训练,MATTAR 学习共享的、任务关系感知的表征空间,从少数源任务向未见任务高效迁移知识,成功率显著高于基线方法,并可在新任务上实现有效微调。
Team adaptation to new cooperative tasks is a hallmark of human intelligence, which has yet to be fully realized in learning agents. Previous work on multi-agent transfer learning accommodate teams of different sizes, heavily relying on the generalization ability of neural networks for adapting to unseen tasks. We believe that the relationship among tasks provides the key information for policy adaptation. In this paper, we try to discover and exploit common structures among tasks for more efficient transfer, and propose to learn effect-based task representations as a common space of tasks, using an alternatively fixed training scheme. We demonstrate that the task representation can capture the relationship among tasks, and can generalize to unseen tasks. As a result, the proposed method can help transfer learned cooperation knowledge to new tasks after training on a few source tasks. We also find that fine-tuning the transferred policies help solve tasks that are hard to learn from scratch.
研究动机与目标
- 解决在智能体数量和输入长度各异的多智能体任务之间迁移协作策略的挑战。
- 通过任务表征显式建模任务间的相似性与差异性,提升迁移效率。
- 仅使用少量源任务即可实现对未见任务的知识迁移,无需从头开始进行任务特定的再训练。
- 提供一个统一的多智能体迁移学习框架,其泛化能力优于仅依赖神经网络归纳偏置的方法。
提出的方法
- 该方法使用前向模型预测下一状态、观测和奖励,基于当前状态、动作和观测,学习基于影响的任务表征。
- 一个共享的超网络(表征解释器)根据任务特定表征生成前向模型参数,实现在不同任务间的参数共享。
- 采用交替固定训练方案:在训练期间将任务表征固定为正交向量,更新表征解释器;推理时固定解释器,微调新任务的表征。
- 策略基于任务表征进行条件化设计,且对群体规模和输入长度保持不变,从而可适应不同团队规模。
- 对于未见任务,通过反向传播经过固定的前向模型,将表征学习为源任务表征的线性组合。
- 该框架整合了群体不变架构与自注意力机制,以增强表征能力与泛化性能。
实验结果
研究问题
- RQ1能否通过有效建模任务关系,实现超越神经网络泛化能力的多智能体策略迁移?
- RQ2共享表征空间是否能同时捕捉多样化协作多智能体任务间的相似性与差异性?
- RQ3将任务表征学习为源任务表征的线性组合,是否能有效实现向未见任务的迁移?
- RQ4对迁移后的策略进行微调,是否能获得优于从头训练新任务的性能?
- RQ5联合训练多个源任务是否比单独训练能提升迁移性能?
主要发现
- MATTAR 在未见协作任务上表现卓越,成功率显著高于 QMIX 和 QPLEX 等最先进基线方法,尤其在 MMM2 等高难度地图上优势明显。
- 对迁移策略进行微调后,性能优于从头训练,证明任务表征提供了强大的策略初始化。
- 即使在单任务学习算法的训练条件下,MATTAR 仍表现更优,表明其具有更强的表征学习能力。
- 学习到的源任务表征线性组合显示,最相似的源任务通常获得最高权重系数,证实模型准确捕捉了有意义的任务关系。
- 在 10m_vs_12m 等场景中,多个源任务(如 5m 和 10m_vs_11m)均有显著贡献,表明 MATTAR 能够从多个源任务中学习混合策略知识。
- 该框架在 SMAC 基准测试中表现与基线方法相当,表明其在多样化协作环境中的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。