Skip to main content
QUICK REVIEW

[논문 리뷰] A Structured Prediction Approach for Generalization in Cooperative Multi-Agent Reinforcement Learning

Nicolas Carion, Gabriel Synnaeve|arXiv (Cornell University)|2019. 10. 19.
Reinforcement Learning in Robotics인용 수 14
한 줄 요약

이 논문은 중앙집중 최적화 절차와 학습된 스코어링 모델을 사용하여 에이전트를 작업에 할당함으로써, 더 큰 문제 인스턴스로의 제로샷 일반화를 가능하게 하는 협동 다에이전트 강화 학습을 위한 구조적 예측 접근법을 제안한다. 이 방법은 훈련 중에 관찰한 것보다 최대 5배 더 많은 에이전트와 작업을 포함하는 스타크래프트: 브루드워 전략에서 강력한 베이스라인을 능가한다.

ABSTRACT

Effective coordination is crucial to solve multi-agent collaborative (MAC) problems. While centralized reinforcement learning methods can optimally solve small MAC instances, they do not scale to large problems and they fail to generalize to scenarios different from those seen during training. In this paper, we consider MAC problems with some intrinsic notion of locality (e.g., geographic proximity) such that interactions between agents and tasks are locally limited. By leveraging this property, we introduce a novel structured prediction approach to assign agents to tasks. At each step, the assignment is obtained by solving a centralized optimization problem (the inference procedure) whose objective function is parameterized by a learned scoring model. We propose different combinations of inference procedures and scoring models able to represent coordination patterns of increasing complexity. The resulting assignment policy can be efficiently learned on small problem instances and readily reused in problems with more agents and tasks (i.e., zero-shot generalization). We report experimental results on a toy search and rescue problem and on several target selection scenarios in StarCraft: Brood War, in which our model significantly outperforms strong rule-based baselines on instances with 5 times more agents and tasks than those seen during training.

연구 동기 및 목표

  • 더 큰 문제 인스턴스로 확장할 때 중앙집중식 다에이전트 강화 학습 방법의 일반화 부족 문제를 해결하기 위해.
  • 다에이전트 협동 문제(MAC 문제)의 국소성과 협동 구조를 활용하여 효율적인 학습과 전이를 가능하게 하기 위해.
  • 재훈련 없이 문제 크기 간에 일반화되는 고수준의 에이전트-작업 할당 정책을 개발하기 위해.
  • 에이전트를 먼 거리의 작업에 흩어지게 하거나 집중 공격를 위해 그룹화하는 등의 복잡한 협동 패턴을 구조적 예측을 통해 모델링하기 위해.
  • 스타크래프트: 브루드워와 같은 실시간 전략 게임에 적합한 실시간 추론 성능을 달성하기 위해.

제안 방법

  • 다에이전트 정책을 고수준의 할당 정책과 저수준의 행동 정책으로 분해하고, 후자의 학습에 집중한다.
  • 에이전트-작업 할당은 학습된 스코어링 모델에 의해 매개변수화된 중심집중 최적화 문제(추론 절차)를 통해 계산된다.
  • 스코어링 모델은 선형 및 이차 항을 사용한다: 즉각적인 협동을 위한 에이전트-작업 스코어와 장기적 협동 패턴을 위한 작업-작업 스코어.
  • 추론 절차는 다항식 시간 내에 수행되어 대규모의 에이전트와 작업으로의 효율적 확장이 가능하다.
  • 모델은 작은 MAC 문제 인스턴스에서 훈련된 후, 직접적으로 더 큰, 볼 수 없는 인스턴스에 적용된다(제로샷 일반화).
  • 다양한 추론 절차와 스코어링 모델 조합이 평가되었으며, 선형 프로그래밍(LP), 이차 최적화(Quad), AMax 포함.

실험 결과

연구 질문

  • RQ1학습된 스코어링 모델을 사용하는 구조적 예측 접근법이 작은 문제 인스턴스에서 큰 문제 인스턴스로의 효과적인 다에이전트 협동 정책을 일반화할 수 있는가?
  • RQ2학습된 스코어를 갖는 중심집중 최적화 절차가 집중 공격나 또는 공간적 흩어짐과 같은 복잡한 협동 패턴을 얼마나 잘 포착할 수 있는가?
  • RQ3목표 함수에 이차 항을 포함함으로써 장기적 협동이 필요한 시나리오에서 일반화 성능이 향상되는가?
  • RQ4이 방법은 스타크래프트: 브루드워와 같은 복잡한 실시간 전략 게임에서 실시간 성능을 달성할 수 있는가?
  • RQ5다양한 문제 크기 간의 제로샷 일반화 측면에서 이 방법은 규칙 기반 베이스라인과 어떻게 비교되는가?

주요 결과

  • m10v10 스타크래프트 시나리오에서 이 방법은 중앙값 승리율 0.94를 기록하여 최고의 히우리스틱(0.83)과 다른 베이스라인을 크게 능가했다.
  • w60v67 시나리오에서 Quad 모델은 승리율 0.33를 기록하여 최고의 히우리스틱(0.13)을 능가했으며, 효과적인 제로샷 일반화를 보였다.
  • 집중 공격이 핵심인 레이스 전투 설정과 같은 장기적 협동이 필요한 시나리오에서, 이차 추론 절차(Quad)는 LP와 AMax보다 뚜렷이 뛰어난 성능을 보였다.
  • 충돌이 자주 발생하는 시나리오인 저그링-하이드라리스크(zh)에서는 LP 모델이 단순한 협동 요구로 인해 잘 작동했고, Quad는 일반화 성능이 떨어져 환경적 제약 조건에 민감함을 보였다.
  • 가장 큰 시나리오(80 vs 82 유닛)에서 이 알고리즘이 500ms 이내에 각 결정을 수행하여 스타크래프트: 브루드워에서 실시간 플레이가 가능했다.
  • 이 모델은 훈련 중에 관찰한 것보다 최대 5배 더 많은 에이전트와 작업을 포함하는 인스턴스로 일반화되었으며, 강력한 제로샷 일반화 성능을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.