Skip to main content
QUICK REVIEW

[논문 리뷰] Honor of Kings Arena: an Environment for Generalization in Competitive Reinforcement Learning

Wei Hua, Jingxiao Chen|arXiv (Cornell University)|2022. 09. 18.
Reinforcement Learning in Robotics인용 수 12
한 줄 요약

이 논문은 유명한 MOBA 게임 'Honor of Kings'을 기반으로 한 경쟁적 다중 에이전트 강화학습 환경인 Honor of Kings Arena를 소개한다. 이 환경은 다양한 영웅(대상)과 상대방에 대한 일반화 능력을 테스트하기 위해 설계되었으며, 구성 가능한 관측값, 행동, 보상 기반의 표준화된 오픈소스 파이썬 인터페이스를 제공한다. 또한 다중 작업 학습과 모델 정련 기법이 직접 정책 전이보다 교차 영웅 및 교차 상대 전이 성능을 크게 향상시킨다는 것을 입증한다.

ABSTRACT

This paper introduces Honor of Kings Arena, a reinforcement learning (RL) environment based on Honor of Kings, one of the world's most popular games at present. Compared to other environments studied in most previous work, ours presents new generalization challenges for competitive reinforcement learning. It is a multi-agent problem with one agent competing against its opponent; and it requires the generalization ability as it has diverse targets to control and diverse opponents to compete with. We describe the observation, action, and reward specifications for the Honor of Kings domain and provide an open-source Python-based interface for communicating with the game engine. We provide twenty target heroes with a variety of tasks in Honor of Kings Arena and present initial baseline results for RL-based methods with feasible computing resources. Finally, we showcase the generalization challenges imposed by Honor of Kings Arena and possible remedies to the challenges. All of the software, including the environment-class, are publicly available at https://github.com/tencent-ailab/hok_env . The documentation is available at https://aiarena.tencent.com/hok/doc/ .

연구 동기 및 목표

  • 다양한 대상과 상대방에 대한 일반화 능력을 테스트할 수 있는 벤치마크 환경의 부족을 해결하기 위해.
  • 세계에서 가장 인기 있는 게임 중 하나인 Honor of Kings를 기반으로 표준화되고 접근성 있고 고도로 최적화된 강화학습 환경을 제공하기 위해.
  • 1v1 MOBA 환경에서 다양한 영웅 역할과 상대 편성에 대한 강화학습 정책의 일반화 능력을 평가하기 위해.
  • 직접 정책 전이의 한계를 입증하고 다중 작업 학습 및 모델 정련과 같은 효과적인 해결책을 제안하기 위해.
  • 오픈소스 배포와 확장 가능한 설계를 통해 커뮤니티 주도의 연구와 향후 대회를 가능하게 하기 위해.

제안 방법

  • 환경은 공식 Honor of Kings 게임 엔진을 기반으로 하며, 복잡한 게임 상태를 저해상도 격자 기반 관측값과 이산 행동 공간으로 추상화한다.
  • 게임 엔진과의 통신을 위한 표준화된 파이썬 API를 제공하며, 킬/데스/어시스트 및 골드 차이와 같은 게임 내 지표에 기반한 구성 가능한 보상 함수를 지원한다.
  • 환경은 20개의 대상 영웅과 20개의 상대 영웅을 지원하여, 대상과 상대 양쪽에 대한 일반화 평가가 가능하다.
  • 정책 학습 중에 다섯 가지 다른 영웅 대 영웅 전투 조합에서 동시에 학습함으로써 다중 작업 학습을 적용하여 정책의 강건성을 향상시킨다.
  • 다양한 작업 전용 정책에서 유닛화된 정책으로 지식을 전이하기 위해 모델 정련을 사용한다.
  • 상대 영웅의 난이도 수준을 다수 지원함으로써, 스킬 수준에 따라 정책 성능을 세밀하게 평가할 수 있다.

실험 결과

연구 질문

  • RQ1한 영웅에서 학습한 강화학습 정책이 동일한 상대에 대해 다른 대상 영웅을 효과적으로 제어할 수 있는가?
  • RQ2동일한 에이전트가 다양한 상대 영웅을 만날 경우, 특히 기계적 특성이 뚜렷한 영웅들에 대해서는 정책 성능이 어떻게 저하되는가?
  • RQ3다중 작업 학습이 다양한 영웅 역할과 상대 편성에 걸쳐 일반화 능력을 얼마나 향상시킬 수 있는가?
  • RQ4모델 정련이 여러 작업 전용 정책에서 단일 일반화 정책으로 지식을 효과적으로 전이할 수 있는가?
  • RQ5다양한 평가 수준(예: 상대 AI 난이도)이 일반화 성능 측정의 신뢰성에 어떤 영향을 미치는가?

주요 결과

  • 한 영웅(예: Diaochan)에서 학습한 정책을 동일한 상대(예: Diaochan)에 대해 다른 대상 영웅로 직접 전이할 경우, 새로운 영웅에 대해 일반화 성능이 떨어지며, 특히 미리 보지 않은 영웅에 대해서는 승리율이 크게 하락한다.
  • 다섯 가지 다양한 영웅 대결 조합에서의 다중 작업 학습이 모든 20개의 대상 영웅에 대해 승리율을 크게 향상시켜, 일반화 능력 향상이 입증되었다.
  • 다섯 개의 작업 전용 정책에서 유도된 모델 정련은 다중 작업 학습과 유사한 성능을 달성하여, 지식 전이의 타당한 대안이 된다.
  • 다중 작업 학습과 정련을 적용한 후에도 일부 영웅 조합(예: Peiqinhu/Shangguanwaner)은 여전히 도전적이며, 승리율이 거의 0에 수렴하여 지속적인 일반화 격차가 존재함을 시사한다.
  • 여러 수준의 상대 AI(예: 레벨-3 Buzhihuowu)를 사용하는 것이 신뢰성 있는 성능 평가에 필수적이며, 단일 수준 기반 벤치마크는 오해의 소지가 있다.
  • 오픈소스 환경과 기준 결과는 경쟁적 다중 에이전트 강화학습에서 일반화 능력에 대한 향후 연구에 강력한 기반을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.