Skip to main content
QUICK REVIEW

[論文レビュー] Honor of Kings Arena: an Environment for Generalization in Competitive Reinforcement Learning

Wei Hua, Jingxiao Chen|arXiv (Cornell University)|Sep 18, 2022
Reinforcement Learning in Robotics被引用数 12
ひとこと要約

本論文は、人気のMOBAゲーム『Honor of Kings』を基盤として、多様なヒーロー(ターゲット)と相手プレイヤーに対する一般化性能をテストすることを目的とした、競争的でマルチエージェント強化学習向けの環境『Honor of Kings Arena』を紹介する。この環境は、観察、行動、報酬をカスタマイズ可能な標準化されたオープンソースPythonインターフェースを備えており、直接的なポリシー転送に比べて、マルチタスク学習とモデル distillation が、異なるヒーローおよび相手に対する転移性能を顕著に向上させることを示している。

ABSTRACT

This paper introduces Honor of Kings Arena, a reinforcement learning (RL) environment based on Honor of Kings, one of the world's most popular games at present. Compared to other environments studied in most previous work, ours presents new generalization challenges for competitive reinforcement learning. It is a multi-agent problem with one agent competing against its opponent; and it requires the generalization ability as it has diverse targets to control and diverse opponents to compete with. We describe the observation, action, and reward specifications for the Honor of Kings domain and provide an open-source Python-based interface for communicating with the game engine. We provide twenty target heroes with a variety of tasks in Honor of Kings Arena and present initial baseline results for RL-based methods with feasible computing resources. Finally, we showcase the generalization challenges imposed by Honor of Kings Arena and possible remedies to the challenges. All of the software, including the environment-class, are publicly available at https://github.com/tencent-ailab/hok_env . The documentation is available at https://aiarena.tencent.com/hok/doc/ .

研究の動機と目的

  • 多様なターゲットと相手プレイヤーの下で、競争的でマルチエージェント強化学習における一般化性能をテストできるベンチマーク環境の不足を解消すること。
  • 世界で最も人気のあるゲームの一つである『Honor of Kings』に基づいた、標準化され、アクセス可能で高度に最適化されたRL環境を提供すること。
  • 1対1のMOBA環境における、異なるヒーロー役割や相手編成に対するRLポリシーの一般化能力を評価すること。
  • 直接的なポリシー転送の限界を実証し、マルチタスク学習やモデル distillation などの有効な解決策を提案すること。
  • オープンソースリリースと拡張可能な設計により、コミュニティ主導の研究および今後のコンペティションを可能にすること。

提案手法

  • 環境は公式の『Honor of Kings』ゲームエンジンに基づき、複雑なゲーム状態を低解像度のグリッドベースの観察と離散的アクション空間に抽象化している。
  • ゲームエンジンとの通信を可能にする標準化されたPython APIを提供しており、キル/デス/アシストやゴールド差といったゲーム内メトリクスに基づいたカスタマイズ可能な報酬関数をサポートしている。
  • フレームワークは20体のターゲットヒーローと20体の相手ヒーローをサポートしており、ターゲットおよび相手の両方における一般化評価を可能としている。
  • ポリシー学習中に5つの異なるヒーロー対ヒーロー対戦を同時に学習することで、マルチタスク学習を実施し、耐性を高めている。
  • 複数のタスク固有のポリシーから知識を抽出し、1つの汎用ポリシーに転送するために、モデル distillation を用いている。
  • 相手ヒーローの難易度を複数レベルで設定可能としており、スキル層ごとのポリシー性能評価を細かく行える。

実験結果

リサーチクエスチョン

  • RQ11体のヒーローで学習した強化学習ポリシーが、同じ相手に対して異なるターゲットヒーローを制御する際に、効果的に一般化できるか?
  • RQ2同じエージェントが、メカニクスが著しく異なる相手ヒーローと対戦する際、ポリシー性能がどの程度低下するか?
  • RQ3マルチタスク学習が、多様なヒーロー役割や相手編成に対して、どの程度一般化能力を向上させられるか?
  • RQ4モデル distillation は、複数のタスク固有ポリシーから知識を抽出し、1つの汎用ポリシーに効果的に転送できるか?
  • RQ5異なる評価レベル(例:相手AIの難易度)が、一般化性能測定の信頼性にどのように影響するか?

主な発見

  • 1体のヒーロー(例:Diaochan)で学習したポリシーを、同じ相手(例:Diaochan)に対して異なるターゲットヒーローに直接転送すると、一般化性能が著しく低下し、未学習のヒーローでは勝率が著しく低下する。
  • 5つの多様なヒーロー対ヒーロー対戦でマルチタスク学習を実施することで、20体のすべてのターゲットヒーローにおいて勝率が向上し、一般化能力の向上が明確に示された。
  • 5つのタスク固有ポリシーから得たモデル distillation により、マルチタスク学習と同等の性能が達成され、知識転送の代替手段として有効であることが示された。
  • マルチタスク学習および distillation を適用しても、一部のヒーロー対戦(例:Peiqinhu/Shangguanwaner)は依然として困難であり、勝率がほぼゼロに近い状態に留まるなど、一般化ギャップが依然として存在することが明らかになった。
  • 複数の相手AI難易度(例:レベル3のBuzhihuowu)を用いることが、信頼性の高い性能評価に不可欠であることが示された。単一難易度のベンチマークでは誤解を招く可能性がある。
  • オープンソースの環境とベースライン結果は、競争的でマルチエージェントRLにおける一般化に関する今後の研究の強固な基盤を提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。