Skip to main content
QUICK REVIEW

[논문 리뷰] StarCraft Micromanagement with Reinforcement Learning and Curriculum Transfer Learning

Kun Shao, Yuanheng Zhu|arXiv (Cornell University)|2018. 04. 03.
Artificial Intelligence in Games참고 문헌 49인용 수 5
한 줄 요약

이 논문은 신경 함수 근사와 맞춤형 보상 설계를 통해 파ameter 공유 다중 에이전트 Sarsa(λ)를 사용한 강화학습 및 교육과정 전이 학습 접근법을 제안하여 스타크래프트의 미크로컨트롤을 구현한다. 이 방법은 점진적인 교육과정 학습을 통해 유닛을 훈련시켜 소규모 시나리오에서는 100% 승리율을 달성하고 대규모 전투에서는 뛰어난 성능을 발휘한다.

ABSTRACT

Real-time strategy games have been an important field of game artificial intelligence in recent years. This paper presents a reinforcement learning and curriculum transfer learning method to control multiple units in StarCraft micromanagement. We define an efficient state representation, which breaks down the complexity caused by the large state space in the game environment. Then a parameter sharing multi-agent gradientdescent Sarsa(λ) (PS-MAGDS) algorithm is proposed to train the units. The learning policy is shared among our units to encourage cooperative behaviors. We use a neural network as a function approximator to estimate the action-value function, and propose a reward function to help units balance their move and attack. In addition, a transfer learning method is used to extend our model to more difficult scenarios, which accelerates the training process and improves the learning performance. In small scale scenarios, our units successfully learn to combat and defeat the built-in AI with 100% win rates. In large scale scenarios, curriculum transfer learning method is used to progressively train a group of units, and shows superior performance over some baseline methods in target scenarios. With reinforcement learning and curriculum transfer learning, our units are able to learn appropriate strategies in StarCraft micromanagement scenarios.

연구 동기 및 목표

  • 높은 차원의 상태 공간과 행동 공간을 가진 복잡하고 동적인 스타크래프트 미크로컨트롤 시나리오에서 다수의 유닛을 제어하는 데 도전한다.
  • 교육과정 전이 학습을 활용하여 대규모 전투에서 샘플 효율성과 학습 성능을 향상시킨다.
  • 정책 공유와 효율적인 상태 표현을 통해 유닛 간 협동 행동을 가능하게 한다.
  • 설계된 내재 보상 함수를 통해 미크로컨트롤에서 희박하고 지연된 보상 문제를 완화한다.

제안 방법

  • 관련된 유닛 및 적 정보에 집중함으로써 복잡한 큰 상태 공간에서의 복잡성을 줄이는 효율적인 상태 표현을 제안한다.
  • 공유 정책을 가진 유닛 간 협동 학습을 가능하게 하는 파ameter 공유 다중 에이전트 경사 하강 Sarsa(λ) (PS-MAGDS) 알고리즘을 도입한다.
  • 유사한 유닛 구성 간의 일반화를 가능하게 하기 위해 행동가치 함수의 함수 근사를 위해 딥 네트워크를 사용한다.
  • 이동과 공격 결정을 균형 있게 조정하여 효과적인 전투 행동을 촉진하는 보상 함수를 설계한다.
  • 점차적으로 더 복잡한 시나리오로 훈련을 진행함으로써 수렴 속도를 향상시키고 최종 성능을 향상시키는 교육과정 전이 학습을 적용한다.
  • 간단한 전투 시나리오(예: 3 대 6)를 먼저 해결한 후 더 복잡한 시나리오(예: 20 대 30)로 점진적으로 전환하는 계층적 훈련 스케줄을 사용한다.

실험 결과

연구 질문

  • RQ1중앙 집중식 조율 없이도 스타크래프트 미크로컨트롤에서 다수의 유닛 간 공유 정책이 효과적인 협동 행동을 이끌 수 있는가?
  • RQ2보상 설계를 통해 미크로컨트롤에서 희박하고 지연된 보상 문제를 효과적으로 완화할 수 있는가?
  • RQ3교육과정 전이 학습이 대규모 스타크래프트 전투 시나리오에서 훈련 효율성과 성능을 크게 향상시킬 수 있는가?
  • RQ4손으로 코딩된 전술 없이도 딥 강화학습 에이전트가 히트앤런, 측면 공격, 집중 공격 등의 복잡한 전략을 얼마나 잘 학습할 수 있는가?
  • RQ5다양한 시나리오 복잡도에서 기준 방법 대비 제안된 PS-MAGDS 알고리즘이 승리율과 수렴 속도 측면에서 어떻게 비교되는가?

주요 결과

  • 소규모 시나리오(예: 3기골리아스 대 6지엘로츠)에서 제안된 방법은 내장된 AI와 대결하여 100% 승리율을 기록하며 효과적인 미크로컨트롤과 협동 행동을 입증했다.
  • 유닛들은 적을 그룹으로 분할하고 고립된 대상을 집중 공격하는 등 글로벌 전략을 성공적으로 학습하고 실행했다.
  • 대규모 시나리오(예: 20마리 대 30저글링)에서 교육과정 전이 학습 접근법이 안정적인 훈련과 기준 방법 대비 뛰어난 성능을 발휘했다.
  • 게임 리플레이 시각화를 통해 빠른 이동, 공격, 후퇴 사이클을 반복하는 히트앤런 같은 국지적 전술을 학습한 것으로 관찰되었다.
  • 교육과정 학습을 통해 확장성과 샘플 효율성이 향상되어 훈련 시간이 단축되고 복잡한 시나리오로의 일반화 능력이 향상되었다.
  • 강력한 성능에도 불구하고 일부 제한점은 존재한다. 예를 들어, 전투 참전 시점이 일관되지 않거나 적을 피하기 위해 지도의 경계 쪽으로 이동하는 경향이 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.