Skip to main content
QUICK REVIEW

[논문 리뷰] The Multi-Agent Reinforcement Learning in MalmÖ (MARLÖ) Competition

Diego Pérez-Liébana, Katja Hofmann|arXiv (Cornell University)|2019. 01. 23.
Reinforcement Learning in Robotics참고 문헌 11인용 수 54
한 줄 요약

MARLÖ 대회는 게임 간 일반화된 에이전트를 촉진하기 위해 여러 Minecraft 기반 3D 게임에서 다중 에이전트 RL 벤치마크를 제안하고, 플레이오프 토너먼트를 통해 평가됩니다.

ABSTRACT

Learning in multi-agent scenarios is a fruitful research direction, but current approaches still show scalability problems in multiple games with general reward settings and different opponent types. The Multi-Agent Reinforcement Learning in MalmÖ (MARLÖ) competition is a new challenge that proposes research in this domain using multiple 3D games. The goal of this contest is to foster research in general agents that can learn across different games and opponent types, proposing a challenge as a milestone in the direction of Artificial General Intelligence.

연구 동기 및 목표

  • 일반적이고 다중 게임의 다중 에이전트 강화 학습 연구를 촉진한다.
  • 여러 개의 3D 게임과 다양한 상대 유형에서 학습할 수 있는 에이전트를 개발한다.
  • 단일 과제에 과적합되는 것을 방지하기 위해 다수의 인스턴스를 갖춘 구성 가능 작업 공간을 제공한다.

제안 방법

  • 협업 및 경쟁 요소를 가진 세 가지 Minecraft 기반 게임(Mob Chase, Build Battle, Treasure Hunt)을 정의한다.
  • 개발 및 반복을 가속하기 위한 스타터 키트와 테스트 과제를 제공한다.
  • 게임과 과제 전반에 걸쳐 에이전트를 평가하기 위해 라운드 로빈 플레이오프 토너먼트를 사용한다.
  • 각 게임의 다양한 변형을 생성하기 위해 높은 매개변수화된 작업 구성을 활용한다.
  • 여러 게임에서 그리고 다수의 다른 에이전트와의 대결에서도 좋은 성능을 요구하여 과적합을 억제한다.

실험 결과

연구 질문

  • RQ1에이전트가 MARLÖ 내의 서로 다른 게임 전반에서 얼마나 잘 일반화할 수 있는가?
  • RQ2각 게임 내에서 서로 다른 작업 변형들 간에 에이전트가 얼마나 일반화하는가?
  • RQ3다중 에이전트 환경에서 서로 다른 상대 유형에 대해 에이전트의 강인성은 어떠한가?
  • RQ4일반화를 위해 구성된 에이전트가 MARLÖ 벤치마크에서 게임별 에이전트를 능가할 수 있는가?

주요 결과

  • MARLÖ는 여러 게임, 작업, 상대를 대상으로 테스트함으로써 다중 에이전트 RL의 일반화를 촉진하는 것을 목표로 한다.
  • 대회는 진입과 평가를 용이하게 하기 위해 공개 벤치마크, 스타터 킷 및 기준선을 제공한다.
  • 최종 순위는 세 가지 게임과 다수의 과제에 걸친 플레이오프 토너먼트에 의해 결정되며, 게임 간 능력향상을 촉진한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.