Skip to main content
QUICK REVIEW

[论文解读] Honor of Kings Arena: an Environment for Generalization in Competitive Reinforcement Learning

Wei Hua, Jingxiao Chen|arXiv (Cornell University)|Sep 18, 2022
Reinforcement Learning in Robotics被引用 12
一句话总结

本文介绍了《王者天下竞技场》(Honor of Kings Arena),一个基于热门多人在线战术竞技场游戏《王者荣耀》的竞技性多智能体强化学习环境,旨在测试在多样化英雄(目标)与对手之间的泛化能力。该环境提供标准化、开源的 Python 接口,支持可配置的观测、动作与奖励机制,并表明多任务训练与模型蒸馏能显著提升跨英雄与跨对手的迁移性能,优于直接策略迁移。

ABSTRACT

This paper introduces Honor of Kings Arena, a reinforcement learning (RL) environment based on Honor of Kings, one of the world's most popular games at present. Compared to other environments studied in most previous work, ours presents new generalization challenges for competitive reinforcement learning. It is a multi-agent problem with one agent competing against its opponent; and it requires the generalization ability as it has diverse targets to control and diverse opponents to compete with. We describe the observation, action, and reward specifications for the Honor of Kings domain and provide an open-source Python-based interface for communicating with the game engine. We provide twenty target heroes with a variety of tasks in Honor of Kings Arena and present initial baseline results for RL-based methods with feasible computing resources. Finally, we showcase the generalization challenges imposed by Honor of Kings Arena and possible remedies to the challenges. All of the software, including the environment-class, are publicly available at https://github.com/tencent-ailab/hok_env . The documentation is available at https://aiarena.tencent.com/hok/doc/ .

研究动机与目标

  • 解决当前缺乏能够测试在多样化目标与对手下竞技性多智能体强化学习中泛化能力的基准环境的问题。
  • 提供一个基于《王者荣耀》(全球最受欢迎的游戏之一)的标准化、可访问且高度优化的强化学习环境。
  • 评估强化学习策略在 1v1 多人在线战术竞技场设置下,针对不同英雄角色与对手阵容配置的泛化能力。
  • 揭示直接策略迁移的局限性,并提出有效的解决方案,如多任务训练与模型蒸馏。
  • 通过开源发布与可扩展设计,推动社区驱动的研究与未来竞赛。

提出的方法

  • 环境基于《王者荣耀》官方游戏引擎构建,将复杂的游戏状态抽象为低分辨率网格化观测与离散动作空间。
  • 提供标准化的 Python API 用于与游戏引擎通信,支持基于游戏内指标(如击杀/死亡/助攻与金币差)的可配置奖励函数。
  • 框架支持 20 个目标英雄与 20 个对手英雄,支持对目标与对手双重泛化能力的评估。
  • 通过在五种不同英雄对战配置上联合训练策略,实施多任务训练,以提升策略鲁棒性。
  • 采用模型蒸馏技术,将多个任务特定策略的知识迁移至单一泛化策略中。
  • 环境支持对手英雄的多种难度等级,实现对策略在不同技能层级下性能的精细化评估。

实验结果

研究问题

  • RQ1在某一英雄上训练的强化学习策略,能否有效泛化至控制不同目标英雄,对抗相同的对手?
  • RQ2当同一智能体面对不同对手英雄时,策略性能如何退化,尤其是面对机制差异显著的对手时?
  • RQ3多任务训练在多大程度上能提升对多样化英雄角色与对手阵容的泛化能力?
  • RQ4模型蒸馏能否有效将多个任务特定策略的知识迁移至单一泛化策略?
  • RQ5不同评估层级(如对手 AI 难度)如何影响泛化性能测量的可靠性?

主要发现

  • 直接将某一英雄(如貂蝉)上训练的策略迁移到控制其他目标英雄对抗相同对手(如貂蝉)时,泛化效果极差,未见英雄的胜率显著下降。
  • 在五种多样化英雄对战配置上进行多任务训练,显著提升了所有 20 个目标英雄的胜率,证明了泛化能力的增强。
  • 从五个任务特定策略中进行模型蒸馏,实现了与多任务训练相当的性能,为知识迁移提供了可行替代方案。
  • 即使采用多任务训练与蒸馏,某些英雄对战(如裴擒虎/上官婉儿)仍具挑战性,胜率接近零,凸显了持续存在的泛化鸿沟。
  • 使用多种对手 AI 难度等级(如等级 3 的不只火武)对于可靠评估至关重要,因为单一难度基准可能具有误导性。
  • 开源环境与基线结果为未来在竞技性多智能体强化学习中研究泛化问题奠定了坚实基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。