Skip to main content
QUICK REVIEW

[논문 리뷰] Hierarchical Reinforcement Learning for Multi-agent MOBA Game

Zhijian Zhang, Hao‐Zheng Li|arXiv (Cornell University)|2019. 01. 23.
Reinforcement Learning in Robotics참고 문헌 15인용 수 16
한 줄 요약

이 논문은 '킹 오브 글로리'와 같은 다중 에이전트 MOBA 게임을 위한 계층적 강화학습(HRL) 프레임워크를 제안한다. 매크로 전략 결정에는 이민드 학습을, 마이크로 조작에는 딥 강화학습을 조합하여 적용한다. 이 방법은 5v5 모드에서 브론즈 등급 AI 상대로 100% 승률을 기록하며, PPO 기준선 대비 뛰어난 성능을 보이며 샘플 효율적이고 API 없이도 훈련 가능한 것을 입증한다.

ABSTRACT

Real Time Strategy (RTS) games require macro strategies as well as micro strategies to obtain satisfactory performance since it has large state space, action space, and hidden information. This paper presents a novel hierarchical reinforcement learning model for mastering Multiplayer Online Battle Arena (MOBA) games, a sub-genre of RTS games. The novelty of this work are: (1) proposing a hierarchical framework, where agents execute macro strategies by imitation learning and carry out micromanipulations through reinforcement learning, (2) developing a simple self-learning method to get better sample efficiency for training, and (3) designing a dense reward function for multi-agent cooperation in the absence of game engine or Application Programming Interface (API). Finally, various experiments have been performed to validate the superior performance of the proposed method over other state-of-the-art reinforcement learning algorithms. Agent successfully learns to combat and defeat bronze-level built-in AI with 100% win rate, and experiments show that our method can create a competitive multi-agent for a kind of mobile MOBA game {\it King of Glory} in 5v5 mode.

연구 동기 및 목표

  • 게임 엔진이나 API에 접근할 수 없는 환경에서 효과적인 AI 에이전트를 훈련하는 데 도전한다.
  • 복잡하고 고차원적인 MOBA 환경에서 보상이 희박하고 지연되는 문제를 해결하기 위해 실시간으로 밀도 높은 보상 구조를 제공한다.
  • 전체 상태 표현과 통신 메커니즘을 통해 5v5 MOBA 시나리오에서 효율적인 다중 에이전트 협업을 가능하게 한다.
  • 과거 성공적인 결정을 활용하는 자기학습 방법을 도입하여 딥 강화학습의 샘플 효율성을 향상시킨다.
  • 비디오 기반 특징 추출과 경량 다중 대상 탐지 기반으로 모바일 기기에서 구동 가능한 훈련 파이프라인을 개발한다.

제안 방법

  • 두 수준의 계층적 강화학습 아키텍처를 구현한다: 매크로 전략 에이전트는 인간 플레이 기록에서 이민드 학습을 통해 이동 및 전술적 결정을 내리고, 마이크로 액션 에이전트는 PPO 기반 강화학습을 통해 실시간 스킬 사용과 전투를 제어한다.
  • 목표 지점과의 거리, 적 제거, 팀 협업 정도에 기반한 실시간으로 밀도 높은 보상 함수를 설계하여, 게임 엔진 API에 접근하지 못하더라도 피드백을 제공한다.
  • 게임 화면 프레임에서 아군/적 위치, 타워 상태 등의 전역 상태 특징을 추출하기 위해 다중 대상 탐지 기술을 통합하여 강화학습 에이전트의 입력으로 활용한다.
  • 이동 효율성을 높이고 탐색 시간을 줄이기 위해 A* 경로 탐색을 활용하여 이동 결정을 수행한다.
  • 현재 정책를 과거 성공적인 롤아웃 결과와 비교하여 정책를 개선하고 수렴 속도를 높이는 자기학습 메커니즘을 도입한다.
  • 데이터 수집을 확장하고 모바일 기기에서의 훈련 시간을 단축하기 위해 분산 샘플링 플랫폼을 구현한다.

실험 결과

연구 질문

  • RQ1게임 엔진 API나 재생 기록에 접근할 수 없는 환경에서 이민드 학습과 딥 강화학습을 융합한 계층적 강화학습 프레임워크가 MOBA 게임에서 뛰어난 성능을 낼 수 있는가?
  • RQ2실시간으로 밀도 높은 보상 함수는 보상이 희박한 MOBA 환경에서 샘플 효율성과 학습 안정성 향상에 얼마나 효과적인가?
  • RQ3과거 성공적인 롤아웃에서 자기학습을 통해 정책 수렴과 승률 향상에 얼마나 기여하는가?
  • RQ4전역 상태 표현을 위한 다중 대상 탐지 기술의 통합은 다중 에이전트 협업과 팀 성능에 어떤 영향을 미치는가?
  • RQ5자원 제약이 있는 모바일 환경에서 제안된 HRL 프레임워크는 '킹 오브 글로리'와 같은 모바일 MOBA 게임에서 인간 수준 또는 초인간 수준의 성능을 달성할 수 있는가?

주요 결과

  • 제안된 HRL 프레임워크는 5v5 모드에서 브론즈 등급 내장 AI 상대로 100% 승률을 기록하여 강력한 일반화 능력과 전술적 능력을 입증했다.
  • 1v1 모드에서 HRL 에이전트는 쉬운 난이도 AI 상대로 89% 승률, 중간 난이도 AI 상대로 83% 승률을 기록했으며, PPO 기준선(각각 62% 및 60%) 대비 뚜렷한 성능 우위를 보였다.
  • 자기학습 방법은 훈련 효율성을 향상시켜 평균 보상이 양수로 유지되고 시간이 지남에 따라 성능이 향상되었으며, 약 600개의 훈련 에피소드 이후 안정적인 학습을 보였다.
  • 절단 실험 결과 각 구성 요소의 핵심적 역할을 확인할 수 있었다: 매크로 전략, 다중 에이전트 협업, 전역 보상, 자기학습 요소를 제거할 경우 승률은 52~60%로 감소하여 이들 요소의 필수성을 입증했다.
  • 다중 대상 탐지 기술은 5v5 모드에서 82%의 정확도, 1v1 모드에서 80%의 정확도를 기록하여 팀 협업에 필수적인 신뢰할 수 있는 전역 상태 입력을 제공했다.
  • 게임 엔진이나 API에 접근하지 못하는 상황에서도 경쟁 가능한 성능을 달성하여, 이동용으로도 활용 가능한 종단 간 비디오 기반 훈련의 가능성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.