Skip to main content
QUICK REVIEW

[논문 리뷰] Testing match-3 video games with Deep Reinforcement Learning

Nicholas Napolitano|arXiv (Cornell University)|2020. 06. 30.
Artificial Intelligence in Games참고 문헌 13인용 수 4
한 줄 요약

이 논문은 매칭-3 비디오 게임의 자동 테스트를 위해 듀얼링 딥 Q-네트워크(DDQN)를 사용하는 것을 제안하며, 시각적 특징을 추출하고 최적의 수를 선택하여 Jelly Juice를 효과적으로 플레이할 수 있도록 에이전트가 학습하는 것으로 입증한다. DDQN은 랜덤 플레이어를 능가하고 여러 레벨에서 인간의 성공률과 밀접하게 유사한 성능을 보이며, 시간이 지남에 따라 뛰어난 적응성과 점진적인 학습 능력을 보인다.

ABSTRACT

Testing a video game is a critical step for the production process and requires a great effort in terms of time and resources spent. Some software houses are trying to use the artificial intelligence to reduce the need of human resources using systems able to replace a human agent. We study the possibility to use the Deep Reinforcement Learning to automate the testing process in match-3 video games and suggest to approach the problem in the framework of a Dueling Deep Q-Network paradigm. We test this kind of network on the Jelly Juice game, a match-3 video game developed by the redBit Games. The network extracts the essential information from the game environment and infers the next move. We compare the results with the random player performance, finding that the network shows a highest success rate. The results are in most cases similar with those obtained by real users, and the network also succeeds in learning over time the different features that distinguish the game levels and adapts its strategy to the increasing difficulties.

연구 동기 및 목표

  • 딥 강화학습을 활용해 매칭-3 게임을 위한 자동 합성 플레이어를 개발하는 것.
  • 딥 강화학습 에이전트가 게임 플레이에서 인간과 유사한 행동을 시뮬레이션할 수 있는지 평가하는 것.
  • Jelly Juice에서 다양한 난이도 수준에서 최적 전략을 학습하는 데에 듀얼링 딥 Q-네트워크의 효과성을 평가하는 것.
  • 성공률 측면에서 DDQN 에이전트의 성능을 랜덤 플레이어 및 실제 인간 사용자와 비교하는 것.

제안 방법

  • 본 연구는 시각적 게임 상태를 처리하고 최적의 수를 선택하기 위해 듀얼링 딥 Q-네트워크(DDQN)를 사용한다.
  • 합성곱 신경망이 원시 게임 프레임에서 특징을 추출하여 에이전트가 게임 환경을 해석할 수 있도록 한다.
  • 경험 재생 메모리는 과거 경험을 저장하여 훈련의 안정성과 샘플 효율성을 향상시킨다.
  • 네트워크는 이중 Q-학습 업데이트 규칙을 사용하여 Q-값 예측의 과대평가 편향을 줄인다.
  • 감독 학습 블록은 유효하지 않은 수를 필터링하고 선택 이전에 행동 확률을 정규화한다.
  • 초기 설정된 게임 구성과 수의 커스터마이즈된 데이터셋을 기반으로 훈련을 수행하며, 수렴을 위해 하이퍼파라미터를 조정한다.

실험 결과

연구 질문

  • RQ1듀얼링 딥 Q-네트워크는 최소한의 인간 감독으로 매칭-3 게임인 Jelly Juice를 효과적으로 학습할 수 있는가?
  • RQ2다양한 레벨에서 DDQN 에이전트의 성능은 랜덤 플레이어 및 실제 인간 플레이어와 비교해 어떻게 되는가?
  • RQ3DDQN 에이전트는 난이도가 증가하는 레벨에 대응해 전략을 시간이 지남에 따라 적응적으로 변화시키는가?
  • RQ4DDQN은 인간 플레이어의 의사결정 패턴을 어느 정도 재현할 수 있는가?

주요 결과

  • 레벨 1에서 DDQN 에이전트는 91.3%의 성공률을 기록했으며, 이는 랜덤 플레이어의 65%보다 뚜렷이 높은 성과이다.
  • 레벨 21에서는 DDQN이 74%의 성공률을 기록했고, 랜덤 플레이어의 54%와 인간 사용자들의 94.7%와 비교해 유사한 성능를 보였다.
  • 가장 난이도가 높은 레벨(505)에서는 DDQN이 9.33%의 성공률을 기록했으며, 랜덤 플레이어의 0%를 뛰어넘고 인간 성능(13.05%)에 가까워졌다.
  • 에이전트는 약 150판의 게임을 거쳐 성능이 안정화되었으며, 레벨 특화된 과제에 점진적으로 적응하고 학습하는 모습을 보였다.
  • 대부분의 레벨에서 DDQN은 이동 선택과 전략 계획 측면에서 인간 플레이어와 유사한 행동을 보였다.
  • 고복잡도 레벨에서도 시스템은 뛰어난 강건성을 보이며, 다른 매칭-3 게임으로의 일반화 잠재력을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.