[논문 리뷰] Rolling Horizon Coevolutionary Planning for Two-Player Video Games
이 논문은 두 명의 플레이어가 참여하는 실시간 비디오 게임을 위한 새로운 의사결정 접근법인 롤링 호라이즌 공진화 알고리즘(RHCA)을 소개한다. 이 알고리즘은 단일 플레이어 게임에서 성공한 롤링 호라이즌 진화 계획법을 다중 플레이어 환경으로 확장하여, 양 플레이어의 행동 시퀀스를 동시에 공진화한다. RHCA는 MCTS와 히우리스틱 기반 컨트롤러를 포함한 여러 일반 게임 AI 알고리즘을 압도하며, 사전 훈련 없이도 다양한 커스터마이즈된 두 명의 플레이어가 참가하는 우주 전투 게임 버전에서 뛰어난 성능을 보였다.
This paper describes a new algorithm for decision making in two-player real-time video games. As with Monte Carlo Tree Search, the algorithm can be used without heuristics and has been developed for use in general video game AI. The approach is to extend recent work on rolling horizon evolutionary planning, which has been shown to work well for single-player games, to two (or in principle many) player games. To select an action the algorithm co-evolves two (or in the general case N) populations, one for each player, where each individual is a sequence of actions for the respective player. The fitness of each individual is evaluated by playing it against a selection of action-sequences from the opposing population. When choosing an action to take in the game, the first action is chosen from the fittest member of the population for that player. The new algorithm is compared with a number of general video game AI algorithms on three variations of a two-player space battle game, with promising results.
연구 동기 및 목표
- 사전 훈련이 필요하지 않은 일반적인 목적의 의사결정 알고리즘을 개발하는 것.
- 단일 플레이어 게임에서 성공한 롤링 호라이즌 진화 알고리즘(RHEA)을 다중 플레이어 환경으로 확장하는 것.
- 통제 가능하고 커스터마이징이 가능한 두 명의 플레이어가 참가하는 전투 환경에서 제안된 알고리즘의 성능을 다양한 일반 게임 AI 방법과 비교 평가하는 것.
- macro-action 크기(각 시퀀스당 동작 수)가 알고리즘 성능에 미치는 영향을 평가하는 것.
- 공진화 계획법이 실시간 게임에서 몬테카를로 트리 서치(MCTS)의 실질적인 대안이 될 수 있는지 탐색하는 것.
제안 방법
- RHCA는 고정된 계획 호라이즌 동안 각 플레이어의 행동 시퀀스를 나타내는 개별 개체로 구성된 두 개의 별도된 행동 시퀀스 집단을 롤링 호라이즌 프레임워크를 사용해 동시에 공진화한다.
- 각 행동 시퀀스의 적합도는 상대편 집단의 일부 행동 시퀀스를 샘플링하여 반복적인 롤아웃을 통해 평가된다.
- 각 플레이어 집단 내에서 가장 적합도가 높은 개체의 첫 번째 동작이 현재 게임 상태에서 실행되기 위해 선택된다.
- 알고리즘은 고정된 시뮬레이션 깊이(계획 호라이즌)를 사용하며, 매 게임 타이크마다 집단을 재평가하고 재최적화하여 미래 행동의 롤링 윈도우를 유지한다.
- 다양한 무작위 초기화 및 게임 실행을 통해 결과를 평균 내어 확률적 게임을 지원한다.
- 이 방법은 MCTS 및 OneStep, OLMCTS, 무작위 또는 기울인 기반 컨트롤러와 같은 다른 오픈 루프 컨트롤러와 대조된다.
실험 결과
연구 질문
- RQ1롤링 호라이즌 진화 계획법은 단일 플레이어 게임에서 성공적으로 다중 플레이어 실시간 게임으로 확장될 수 있는가?
- RQ2RHCA의 성능는 MCTS와 히우리스틱 기반 컨트롤러와 같은 기존의 일반 게임 AI 알고리즘과 비교해 두 명의 플레이어 환경에서 어떻게 나타나는가?
- RQ3macro-action 크기(각 시퀀스당 동작 수)가 RHCA와 RHGA의 성능에 상당한 영향을 미치는가?
- RQ4공진화 계획법은 사전 훈련 없이도 강력한 성능을 달성할 수 있으며, 이는 빠른 게임 디자인 피드백에 적합한가?
- RQ5RHCA는 실시간 두 명의 플레이어 게임에서 MCTS의 실질적이고 경쟁 가능한 대안이 될 수 있는가?
주요 결과
- RHCA는 모든 테스트 게임에서 평균 승리율 76.1%를 기록하여 라운드 로빈 토너먼트에서 모든 다른 컨트롤러를 압도했다.
- 무기 없이 단순한 전투 게임(G₁)에서는 랜덤 컨트롤러(RND)와의 전적에서 93.5%의 승리율을 기록했으며, 기울인 컨트롤러(ROT)와의 전적에서는 100%의 승리율을 기록했고, OneStep 컨트롤러와의 전적에서는 87.0%의 승리율을 기록했다.
- RHCA는 평균 승리율 68.3%를 기록한 OLMCTS와 평균 승리율 70.1%를 기록한 RHGA를 뚜렷이 앞섰다.
- RHCA와 RHGA의 성능는 각 시퀀스당 동작 수가 증가할수록 떨어지는 경향을 보였으며, 이는 짧은 계획 호라이즌이 더 나은 결과를 낳는다는 것을 시사한다.
- OneStep은 전반적으로 성능이 열악했으며, RND와의 전적에서 51.0%의 승리율을 기록했고, ROT와의 전적에서는 0.0%의 승리율을 기록했지만, G₁에서 ROT를 이긴 특정 케이스를 제외하고는 전반적으로 열등했다.
- OLMCTS는 중간 정도의 성능을 보였으며 평균 승리율 68.3%를 기록했지만, 어떤 게임 버전에서도 RHCA나 RHGA에 명백한 이점이 없었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.