Skip to main content
QUICK REVIEW

[논문 리뷰] AlphaStar Unplugged: Large-Scale Offline Reinforcement Learning

Michaël Mathieu, Sherjil Ozair|arXiv (Cornell University)|2023. 08. 07.
Artificial Intelligence in Games인용 수 5
한 줄 요약

이 논문은 슈퍼컴퓨터가 아닌 인간이 플레이한 스타크래프트 II 게임을 100만 개 이상 활용한 대규모 오프라인 강화학습 벤치마크인 AlphaStar Unplugged을 소개한다. 한 단계 오프라인 RL 방법은 먼저 행동 정책와 가치 함수를 학습한 후, 가치 함수를 활용해 정책을 향상시키는 방식으로, 이는 이전의 AlphaStar 행동 복제 에이전트와 대결했을 때 90%의 승률을 기록하며, 이 복잡한 고차원 환경에서 기존의 표준 오프라인 RL 접근 방식을 능가한다.

ABSTRACT

StarCraft II is one of the most challenging simulated reinforcement learning environments; it is partially observable, stochastic, multi-agent, and mastering StarCraft II requires strategic planning over long time horizons with real-time low-level execution. It also has an active professional competitive scene. StarCraft II is uniquely suited for advancing offline RL algorithms, both because of its challenging nature and because Blizzard has released a massive dataset of millions of StarCraft II games played by human players. This paper leverages that and establishes a benchmark, called AlphaStar Unplugged, introducing unprecedented challenges for offline reinforcement learning. We define a dataset (a subset of Blizzard's release), tools standardizing an API for machine learning methods, and an evaluation protocol. We also present baseline agents, including behavior cloning, offline variants of actor-critic and MuZero. We improve the state of the art of agents using only offline data, and we achieve 90% win rate against previously published AlphaStar behavior cloning agent.

연구 동기 및 목표

  • 스타크래프트 II에서 실제 인간 플레이 데이터를 활용해 도전적이고 대규모인 오프라인 강화학습 벤치마크를 구축하는 것.
  • 장기적인 계획이 필요하고 보상이 희박한 부분관측 다중에이전트 환경에서 오프라인 RL 알고리즘의 성능을 평가하는 것.
  • 고차원적이고 실제 세계와 유사한 데이터에서 기존 오프라인 RL 방법의 한계를 규명하는 것 — 예를 들어, 수익 조건 기반 행동 복제 및 Q함수 기반 접근 방식.
  • 행동 정책와 가치 함수를 먼저 학습하고, 이후 가치 함수를 활용해 정책을 향상시키는 새로운 이중단계 오프라인 RL 레시피 개발 및 검증.
  • 온라인 환경 상호작용이 필요 없이 스타크래프트 II RL 연구에 더 넓은 접근성을 제공함으로써 컴퓨팅 요구량을 줄이는 것.

제안 방법

  • 블리자드의 배틀넷에서 확보한 인간 플레이어의 100만 개 이상의 스타크래프트 II 리플레이 데이터셋을 활용하며, 공식 출시 버전의 일부로 선별된 자료.
  • 일致한 오프라인 RL 에이전트 벤치마킹을 가능하게 하기 위해 표준화된 API와 평가 프로토콜을 정의.
  • 이중단계 학습 레시피 제안: 먼저 오프라인 데이터에서 행동 정책와 행동 가치 함수를 사전 학습한 후, 학습 또는 추론 중에 가치 함수를 활용해 정책을 개선.
  • 환경 상호작용 없이 고정된 데이터셋에서 학습하기 위해, 행동 복제, 오프라인 액터-크리틱, MuZero 변종과 같은 한 단계 오프라인 RL 접근 방식을 활용.
  • 가치 함수를 비용 신호로 활용해 정책 개선을 이끌어내며, 반복적인 오프정책 업데이트나 복잡한 가치 함수 보정이 필요 없도록 함.
  • 자기연쇄 행동 공간의 함수 인수에만 작용하는 Q함수를 구현해 전체 자기연쇄 행동 분포 모델링의 과제를 피함.
Figure 1 : Histogram of player MMR from replays used for training.
Figure 1 : Histogram of player MMR from replays used for training.

실험 결과

연구 질문

  • RQ1표준 오프라인 RL 알고리즘, 예를 들어 수익 조건 기반 행동 복제 및 Q함수 기반 방법은 스타크래프트 II처럼 대규모 고차원 부분관측 환경에 효과적으로 일반화될 수 있는가?
  • RQ2전문가나 합성 트래잭터리가 아닌 약한 인간 플레이어의 데이터만으로 훈련된 오프라인 RL 방법은 어떤 성능을 보일 수 있는가?
  • RQ3정책 개선이 사전에 학습된 가치 함수에 의해 이끄는 한 단계 오프라인 RL 접근 방식이, 더 복잡한 반복적 오프라인 RL 알고리즘보다 복잡한 환경에서 더 뛰어난 성능을 낼 수 있는가?
  • RQ4행동 정책와 가치 함수 학습의 조합이 장기적 계획과 희박한 보상이 존재하는 과제에서 오프라인 RL에서 강력한 성능을 내는 데 얼마나 기여하는가?
  • RQ5표준 방법이 실패하는 상황에서, 대규모 오프라인 RL에서 성공을 이끄는 주요 아키텍처 및 학습 설계 선택 사항은 무엇인가?

주요 결과

  • 표준 오프라인 RL 방법, 예를 들어 수익 조건 기반 행동 복제 및 Q함수 기반 접근 방식은 가장 약한 상대와의 대결에서 승리한 게임이 하나도 없었으며, 이는 이 벤치마크에서 일반화 능력이 열악함을 시사한다.
  • 모든 테스트된 표준 오프라인 RL 방법이 단순한 조건부가 아닌 행동 복제 기반 베이스라인보다 성능이 열 劣함을 보이며, 이는 실제 세계와 유사한 다양한 인간 데이터에서 기존 접근 방식의 한계를 드러낸다.
  • 행동 정책와 가치 함수를 먼저 학습하고, 이후 가치 함수를 활용해 정책을 향상시키는 한 단계 오프라인 RL 방법이 이전에 발표된 AlphaStar 행동 복제 에이전트와의 대결에서 90%의 승률을 기록했다.
  • 성능이 뛰어난 에이전트의 성공은 항상 사전 학습된 행동 가치 함수를 활용해 정책 개선을 이끄는 데 기인해 있었으며, 이는 가치 함수가 효과적인 오프라인 학습에서 핵심적인 역할을 한다는 것을 시사한다.
  • 벤치마크는 소규모 오프라인 RL 벤치마크에서 최첨단 알고리즘이 대규모 실제 세계와 유사한 환경으로 일반화되지 않음을 드러내며, 새로운 알고리즘 설계가 필요함을 시사한다.
  • 온라인 환경 상호작용을 제거하고 오프라인 데이터를 사용함으로써 컴퓨팅 요구량을 크게 줄여, 대규모 스타크래프트 II RL 연구를 더 넓은 연구 공동체가 접근할 수 있도록 한다.
Figure 2 : Training procedure.
Figure 2 : Training procedure.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.