Skip to main content
QUICK REVIEW

[논문 리뷰] Fever Basketball: A Complex, Flexible, and Asynchronized Sports Game Environment for Multi-agent Reinforcement Learning

Hangtian Jia, Yujing Hu|arXiv (Cornell University)|2020. 12. 06.
Reinforcement Learning in Robotics참고 문헌 44인용 수 8
한 줄 요약

이 논문은 다양한 액션 실행 시간, 다수의 플레이어 역할, 다양한 경기 상황을 갖춘 현실적인 농구 플레이를 시뮬레이션하는 오픈소스이자 복잡하며 비동기식인 다에이전트 강화학습 환경인 Fever Basketball를 소개한다. 이 환경은 팀 간 협업을 향상시키고 3v3 온라인 경기에서 인간 플레이어 대비 70%의 승률을 기록하는 통합 커리큘럼 훈련(ICT) 프레임워크를 제안하여 장기적 보상, 희박한 보상, 비정상성 문제를 효과적으로 해결하고 있음을 보여준다.

ABSTRACT

The development of deep reinforcement learning (DRL) has benefited from the emergency of a variety type of game environments where new challenging problems are proposed and new algorithms can be tested safely and quickly, such as Board games, RTS, FPS, and MOBA games. However, many existing environments lack complexity and flexibility and assume the actions are synchronously executed in multi-agent settings, which become less valuable. We introduce the Fever Basketball game, a novel reinforcement learning environment where agents are trained to play basketball game. It is a complex and challenging environment that supports multiple characters, multiple positions, and both the single-agent and multi-agent player control modes. In addition, to better simulate real-world basketball games, the execution time of actions differs among players, which makes Fever Basketball a novel asynchronized environment. We evaluate commonly used multi-agent algorithms of both independent learners and joint-action learners in three game scenarios with varying difficulties, and heuristically propose two baseline methods to diminish the extra non-stationarity brought by asynchronism in Fever Basketball Benchmarks. Besides, we propose an integrated curricula training (ICT) framework to better handle Fever Basketball problems, which includes several game-rule based cascading curricula learners and a coordination curricula switcher focusing on enhancing coordination within the team. The results show that the game remains challenging and can be used as a benchmark environment for studies like long-time horizon, sparse rewards, credit assignment, and non-stationarity, etc. in multi-agent settings.

연구 동기 및 목표

  • 기존 게임 환경이 다에이전트 강화학습에서 동기화된 액션을 전제로 하고 있으며 복잡도가 낮다는 한계를 해결하기 위해.
  • 단일 에이전트 및 다에이전트 훈련을 모두 지원하는 다양한 역할과 경기 모드를 갖춘 현실적이고 유연하며 도전적인 스포츠 환경을 구축하기 위해.
  • 액션 실행의 비동기성 영향이 다에이전트 학습에 미치는 영향을 조사하고, 그로 인한 비정상성 영향을 완화할 수 있는 방법을 개발하기 위해.
  • 팀 간 협업과 복잡한 스포츠 환경에서의 장기적 과제 학습을 향상시키는 커리큘럼 기반 훈련 프레임워크를 설계하고 평가하기 위해.
  • Fever Basketball를 장기적 보상 할당, 희박한 보상, 협업 문제를 연구하기 위한 벤치마크로 정립하기 위해.

제안 방법

  • Fever Basketball 환경은 상업용 농구 엔진 기반으로 구축되었으며, 점프볼, 패assing, 슛팅, 리바운드, 위치 역할(PG, C, SG 등)을 포함한 완전한 농구 규칙을 지원한다.
  • 플레이어에게 서로 다른 액션 실행 시간을 할당하여 비동기성을 도입함으로써 실제 반응 시간의 변동성을 시뮬레이션하고 비정상성을 증가시킨다.
  • 1v1, 2v2, 3v3 등의 훈련 시나리오와 공격, 수비, 프리볼, 볼클리어 등의 경기 모드를 제공하여 다양한 과제 난이도에서 평가할 수 있도록 한다.
  • 비동기성에 기반한 액션 선택 조정을 통해 공동 액션 학습자의 비정상성을 줄이기 위해 두 가지 히우리스틱 방법(EXP-Ms 및 EXP-Sp)을 제안한다.
  • 하위 과제를 위한 캐스케이딩 커리큘럼과 팀 협업을 향상시키기 위한 협업 커리큘럼 스위처를 조합한 통합 커리큘럼 훈련(ICT) 프레임워크를 제안한다.
  • 프레임워크는 기반 강화학습 알고리즘으로 APEX-Rainbow를 사용하며, 게임 규칙 기반 커리큘럼 스케줄링을 통해 경기의 각 단계에서 정책 학습을 안내한다.

실험 결과

연구 질문

  • RQ1액션 실행의 비동기성이 스포츠 환경에서 다에이전트 강화학습 알고리즘의 성능에 어떤 영향을 미치는가?
  • RQ2커리큘럼 기반 훈련은 복잡하고 보상이 희박한 스포츠 환경, 예를 들어 농구와 같은 환경에서 협업과 장기적 학습을 향상시킬 수 있는가?
  • RQ3히우리스틱 방법이 공동 액션 학습에서 유도하는 비정상성의 정도를 어느 정도 완화할 수 있는가?
  • RQ4통합 커리큘럼 훈련(ICT) 프레임워크는 인간 플레이어 대비 승률 측면에서 표준 기반 훈련 베이스라인과 비교해 어떻게 성과를 내는가?
  • RQ5Fever Basketball 환경은 희박한 보상, 보상 할당, 비정상성 문제를 포함한 다에이전트 강화학습 알고리즘 평가를 위한 견고한 벤치마크로 기능할 수 있는가?

주요 결과

  • 통합 커리큘럼 훈련(ICT) 프레임워크는 300일간의 온라인 평가에서 인간 플레이어 대비 70%의 승률을 기록했으며, 기반 커리큘럼 방법이 약 30%의 승률에 머무르는 것과 비교해 뚜렷한 승리 우위를 보였다.
  • ICT 프레임워크는 향상된 협업 능력을 보였으며, AI 팀이 협업 커리큘럼 스위처 없이 훈련된 모델에서 부재했던 고급 전술인 가이브-앤드-고를 성공적으로 실행할 수 있었다.
  • 제거 실험 결과, 단일 모델 훈련이 가장 열악한 성능을 보였고, 캐스케이딩 커리큘럼과 협업 스위칭 기능을 추가할수록 성능 향상이 뚜렷했다.
  • ICT 모델의 승률은 온라인 평가 초기 단계에서 기반 모델 대비 두 배 이상 증가하여 강력한 일반화 능력과 적응 능력을 보였다.
  • AI 팀의 경기 참가 비율이 시간이 지남에 따라 증가하여, 향상된 AI 품질이 플레이어의 참여도와 게임의 가치를 높였음을 시사했다.
  • 결과는 Fever Basketball가 장기적 보상, 희박한 보상, 비정상성 문제를 포함한 다에이전트 강화학습 문제에 있어 여전히 도전적인 벤치마크로 유지됨을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.