[论文解读] TiKick: Towards Playing Multi-agent Football Full Games from Single-agent Demonstrations
TiKick 提出了一种端到端的离线强化学习框架,该框架在 Google Research Football 环境中,仅使用单智能体专家演示数据,即可训练多智能体足球 AI。通过利用来自自对弈单智能体专家的大规模回放缓冲区数据集,并结合具有新颖算法组件的分布式离线训练流水线,TiKick 在完整游戏场景中实现了最先进性能,并通过更低的样本复杂度加速了下游多智能体强化学习训练。
Deep reinforcement learning (DRL) has achieved super-human performance on complex video games (e.g., StarCraft II and Dota II). However, current DRL systems still suffer from challenges of multi-agent coordination, sparse rewards, stochastic environments, etc. In seeking to address these challenges, we employ a football video game, e.g., Google Research Football (GRF), as our testbed and develop an end-to-end learning-based AI system (denoted as TiKick) to complete this challenging task. In this work, we first generated a large replay dataset from the self-playing of single-agent experts, which are obtained from league training. We then developed a distributed learning system and new offline algorithms to learn a powerful multi-agent AI from the fixed single-agent dataset. To the best of our knowledge, Tikick is the first learning-based AI system that can take over the multi-agent Google Research Football full game, while previous work could either control a single agent or experiment on toy academic scenarios. Extensive experiments further show that our pre-trained model can accelerate the training process of the modern multi-agent algorithm and our method achieves state-of-the-art performances on various academic scenarios.
研究动机与目标
- 解决 Google Research Football(GRF)等复杂、稀疏奖励、随机性环境中的多智能体协作挑战。
- 克服先前工作仅能控制单个智能体或仅适用于简化学术场景的局限性。
- 开发一种可扩展的、端到端的学习系统,仅使用单智能体专家的离线数据,即可掌握完整的 11 名球员 GRF 游戏。
- 通过利用预训练的离线模型作为初始化,加速现代多智能体强化学习。
- 证明仅从单专家轨迹进行离线模仿与强化学习,即可生成高性能、可泛化的多智能体策略。
提出的方法
- 在联赛训练设置下,通过训练好的单智能体专家自对弈,生成大规模回放缓冲区数据集。
- 设计了一套分布式离线强化学习系统,从固定的单智能体演示数据中训练多智能体策略。
- 提出了专为多智能体场景设计的新离线强化学习算法,结合行为克隆与价值正则化等技术以稳定学习过程。
- 采用 MAPPO 算法作为多智能体训练的基础架构,并使用离线模型的预训练权重进行初始化。
- 在迁移至不同动作空间的场景时,对最终层应用权重冻结等架构修改。
- 采用课程式评估与 TrueSkill 评分机制,对多样化场景与对手的性能进行基准测试。
实验结果
研究问题
- RQ1能否通过单智能体演示的离线强化学习,成功训练出能够掌握完整 11 名球员 Google Research Football 游戏的多智能体策略?
- RQ2预训练的离线模型在加速现代多智能体强化学习算法训练方面有多高效?
- RQ3从专家轨迹进行的离线模仿与强化学习,在具有多智能体协作的复杂、稀疏奖励、随机性环境中,其泛化能力如何?
- RQ4与随机初始化或随机演员初始化相比,使用离线预训练在多智能体强化学习中的样本效率与性能增益如何?
- RQ5所提出的方法是否能在 GRF 的完整游戏与学术场景中均优于现有方法?
主要发现
- TiKick 是首个仅使用单智能体专家离线数据,成功接管完整 11 名球员 Google Research Football 游戏的学习型 AI 系统。
- 预训练的 TiKick 模型显著加速了下游多智能体强化学习训练,在五个学术场景中的四个,仅用 100 万次训练步数即达到最高分。
- 在所有五个 GRF 学术场景中,TiKick 的性能最佳,样本复杂度最低,优于包括 QMIX、MADDPG、CDS 和 MAPPO 在内的基线方法。
- 最终的 TiKick 模型在所有评估算法中拥有最高的 TrueSkill 评分,证实其在对抗内置 AI 对手时具备更优的实力与一致性。
- 该方法展现出强大的泛化能力,即使在 Hard_Counter-attack 等高动态、多对手的挑战性场景中,也优于基线方法。
- 消融实验确认,仅使用单专家演示进行离线预训练,即可生成高性能的多智能体策略,且无需在预训练阶段进行在线交互。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。