Skip to main content
QUICK REVIEW

[논문 리뷰] On Multi-Agent Learning in Team Sports Games

Yunqi Zhao, Igor Borovikov|arXiv (Cornell University)|2019. 06. 25.
Reinforcement Learning in Robotics참고 문헌 57인용 수 12
한 줄 요약

이 논문은 팀 스포츠 비디오 게임에서 인간처럼 행동하는 고수준의 에이전트를 훈련하기 위해 계층적 강화학습 접근법을 제안한다. 저수준 행동은 모방 학습으로, 고수준 전략은 딥 RL(PPO/DQN)으로 학습한다. 결과적으로 PPO는 2v2 경기에서 DQN보다 약간 우세한 성과(55:45)를 보였으며, DQN 대비 훈련 수렴 속도가 10배 빠르다. 반면 Rainbow는 부적절한 초모수 설정으로 실패했다.

ABSTRACT

In recent years, reinforcement learning has been successful in solving video games from Atari to Star Craft II. However, the end-to-end model-free reinforcement learning (RL) is not sample efficient and requires a significant amount of computational resources to achieve superhuman level performance. Model-free RL is also unlikely to produce human-like agents for playtesting and gameplaying AI in the development cycle of complex video games. In this paper, we present a hierarchical approach to training agents with the goal of achieving human-like style and high skill level in team sports games. While this is still work in progress, our preliminary results show that the presented approach holds promise for solving the posed multi-agent learning problem.

연구 동기 및 목표

  • 팀 스포츠 게임에서 인간처럼 행동하는 에이전트를 개발하여 신뢰성과 고수준 기량을 동시에 확보한다.
  • 엔드 투 엔드 모델-프리 RL의 한계인 인간처럼 행동하지 못하는 문제와 샘플 비효율성 문제를 해결한다.
  • 저수준 행동은 모방 학습으로, 고수준 전략은 RL로 학습하는 계층적 학습을 탐색한다.
  • 훈련된 정책이 새로운 환경에서 일반화 및 강건성 확보 정도를 평가한다.
  • 다중 에이전트 팀 스포츠 환경에서의 보상 조정과 책임 할당 문제를 조사한다.

제안 방법

  • 중간 수준 시뮬레이터(STS2)를 활용해 저수준 행동(모방 학습)과 고수준 전략(딥 RL)을 분리하는 계층적 프레임워크를 구축한다.
  • 딥 Q 네트워크(DQN)와 프록시멀 포licy 옵티마이제이션(PPO)을 사용해 희박한 보상과 조정된 보상을 갖는 에이전트를 훈련시킨다.
  • 보상 조정은 골 득점에 +1, 실점에 -1, 볼 휴지 획득에 +0.8, 볼 실점에 -0.8을 적용한다.
  • 공동 정책을 사용한 중심화된 훈련을 탐색했지만, 고수준 플래너가 없으면서 유의미한 행동을 학습하지 못했다.
  • STS2 시뮬레이터를 사용해 전체 게임 환경에 배포하기 전에 정책을 훈련 및 평가한다.
  • 미래 통합을 위해 전이 학습 및 중심화된 훈련 방법(QMIX, 중심화된 크리틱)을 고려한다.

실험 결과

연구 질문

  • RQ1계층적 RL 접근법이 팀 스포츠 게임에서 인간처럼 행동하면서도 고수준 기량을 갖춘 에이전트를 생성할 수 있는가?
  • RQ2희박한 보상 조건 하에서 PPO는 DQN에 비해 다중 에이전트 전략 훈련에 얼마나 효과적인가?
  • RQ3다른 도메인에서는 성공한 바를 보였지만, 이 환경에선 왜 Rainbow가 실패했는가?
  • RQ4기존 AI 상대와의 대결에서 훈련된 정책이 새로운 상대에게 얼마나 일반화되는가?
  • RQ5팀 스포츠 다중 에이전트 RL 환경에서 책임 할당과 팀 협업을 어떻게 향상시킬 수 있는가?

주요 결과

  • PPO는 약 6개월의 인간 경험 수준에서 수렴했고, DQN은 약 5년이 소요되어 훈련 효율성이 10배 빨라졌다.
  • 직접 대결에서 PPO 팀은 DQN 팀을 55:45로 이겼으며, 더 나은 일반화 능력과 정책 강건성을 보였다.
  • DQN 에이전트는 기존 AI 상대와의 대결에서 50%의 득점 비율을 기록해 훈련 환경에서 중간 정도의 성공을 거두었다.
  • Rainbow 에이전트는 모든 실험에서 실패했으며, 분포형 RL 또는 우선순위 경험 재현의 부적절한 초모수 설정이 원인일 가능성이 높다.
  • 단일 정책로 두 에이전트의 중심화된 훈련은 의미 있는 행동을 학습하지 못했으며, 이는 고수준 플래너가 필요함을 시사한다.
  • 적절한 보상 조정을 통해 에이전트는 공격과 수비 역할을 명확히 학습했으며, 팀 협업과 볼 휴지 통제 능력이 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.