Skip to main content
QUICK REVIEW

[논문 리뷰] A Survey of Deep Reinforcement Learning in Video Games

Kun Shao, Zhentao Tang|arXiv (Cornell University)|2019. 12. 23.
Reinforcement Learning in Robotics참고 문헌 91인용 수 148
한 줄 요약

이 설문은 DRL 기초(가치 기반, 정책 기울기, 모델 기반) 을 다루고 Atari, ViZDoom, StarCraft, Dota 유사 환경을 포함한 2D/3D 게임에서 성과와 과제를 요약합니다.

ABSTRACT

Deep reinforcement learning (DRL) has made great achievements since proposed. Generally, DRL agents receive high-dimensional inputs at each step, and make actions according to deep-neural-network-based policies. This learning mechanism updates the policy to maximize the return with an end-to-end method. In this paper, we survey the progress of DRL methods, including value-based, policy gradient, and model-based algorithms, and compare their main techniques and properties. Besides, DRL plays an important role in game artificial intelligence (AI). We also take a review of the achievements of DRL in various video games, including classical Arcade games, first-person perspective games and multi-agent real-time strategy games, from 2D to 3D, and from single-agent to multi-agent. A large number of video game AIs with DRL have achieved super-human performance, while there are still some challenges in this domain. Therefore, we also discuss some key points when applying DRL methods to this field, including exploration-exploitation, sample efficiency, generalization and transfer, multi-agent learning, imperfect information, and delayed spare rewards, as well as some research directions.

연구 동기 및 목표

  • 왜 DRL이 게임 AI에 효과적인지와 고유한 도전 과제를 동기 부여한다.
  • DRL 방법(가치 기반, 정책 기울기, 모델 기반)과 주요 알고리즘을 카탈로그하고 비교한다.
  • 게임 장르별 DRL 성과를 조사한다(2D/3D, 단일 에이전트/다중 에이전트).
  • 실용적 도전 과제(탐색, 샘플 효율성, 일반화, 전달, 불완전 정보)를 논의한다.
  • 게임 AI 도메인에 DRL을 적용하기 위한 향후 방향을 개요한다.

제안 방법

  • DL 및 RL의 배경을 설명하고 MDP 기호를 형식화한다.
  • 주요 DRL 방법 계통과 대표 알고리즘(DQN, Rainbow, IQN, SAC, MuZero 등)을 요약한다.
  • 경험 재생, 목표 네트워크, 액터-비평가, 분포적 RL, 계획 모델 등 핵심 아키텍처적 및 알고리즘적 혁신을 제시한다.
  • 게임에서 DRL의 학습 플랫폼 및 평가 벤치마크를 논의한다.
  • Atari 및 기타 게임 도메인에서 성능 추세와 경험적 결과에 대한 비교 분석을 제공한다.

실험 결과

연구 질문

  • RQ1다양한 게임 장르와 설정에서 게임 AI에 가장 효과적인 DRL 방법은 무엇인가?
  • RQ2가치 기반, 정책 기울기, 모델 기반 DRL 방법은 샘플 효율성, 안정성, 일반화 측면에서 비디오 게임에서 어떻게 비교되는가?
  • RQ3게임용 DRL의 발전을 촉진하는 플랫폼, 벤치마크 및 실험 구성은 무엇인가?
  • RQ4단일 에이전트 및 다중 에이전트 게임 환경에 DRL을 적용하는 주요 도전 과제와 향후 방향은 무엇인가?

주요 결과

  • DRL 방법은 2D 및 3D 환경에서 다수의 비디오 게임에서 초인간 성능을 달성한다.
  • Atari 벤치마크에서 극적인 이점이 나타나: Rainbow 및 Ape-X 변형은 초기 DQN 방식보다 상당히 우수하다.
  • 분포형 및 다중 에이전트 확장(C51, QR-DQN, IQN, Ape-X DQN/DQfD)은 평균 및 중앙값 Atari 점수에서 큰 향상을 보인다.
  • 모델 기반 접근(MuZero, TreeQN)은 복잡한 도메인에서 DRL의 계획 기반 개선을 촉진한다.
  • 일인칭 슈팅 및 RTS 도메인은 부분 관찰성과 다중 에이전트 협력과 같은 추가 도전을 제시하여 기억, 탐색 및 전달에 대한 추가 발전을 촉진한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.