Skip to main content
QUICK REVIEW

[논문 리뷰] Randomized Entity-wise Factorization for Multi-Agent Reinforcement Learning

Shariq Iqbal, Christian A. Schroeder de Witt|arXiv (Cornell University)|2020. 06. 07.
Reinforcement Learning in Robotics참고 문헌 48인용 수 15
한 줄 요약

이 논문은 랜덤 샘플링된 하위 그룹의 에이전트와 엔티티에 걸쳐 유틸리티를 인과적으로 분해하는 방식인 상상 학습을 위한 랜덤화된 엔티티 기반 인과분해(REFIL)를 제안한다. 이 방법은 다중 작업 다중 에이전트 강화학습에서 가치 함수를 랜덤으로 선택된 하위 그룹의 에이전트와 엔티티에 걸쳐 유틸리티를 분해하도록 훈련시켜 성능을 향상시킨다. 부분 관측을 상상하고 다양한 작업 간의 공통 패턴을 학습함으로써 REFIL은 일반화 능력을 향상시키며, 다양한 팀 편성 조건을 가진 복잡한 스타크래프트 미크로매니지먼트 환경에서 강력한 기준 모델들을 능가한다.

ABSTRACT

Multi-agent settings in the real world often involve tasks with varying types and quantities of agents and non-agent entities; however, common patterns of behavior often emerge among these agents/entities. Our method aims to leverage these commonalities by asking the question: ``What is the expected utility of each agent when only considering a randomly selected sub-group of its observed entities?'' By posing this counterfactual question, we can recognize state-action trajectories within sub-groups of entities that we may have encountered in another task and use what we learned in that task to inform our prediction in the current one. We then reconstruct a prediction of the full returns as a combination of factors considering these disjoint groups of entities and train this ``randomly factorized" value function as an auxiliary objective for value-based multi-agent reinforcement learning. By doing so, our model can recognize and leverage similarities across tasks to improve learning efficiency in a multi-task setting. Our approach, Randomized Entity-wise Factorization for Imagined Learning (REFIL), outperforms all strong baselines by a significant margin in challenging multi-task StarCraft micromanagement settings.

연구 동기 및 목표

  • 에이전트와 엔티티의 수와 종류가 변하는 다중 에이전트 강화학습(MARL) 환경에서 일반화 가능한 정책을 학습하는 데 도전하는 것.
  • 에이전트 하위 그룹 내에서 공통적인 행동 패턴을 식별하여, 다른 팀 편성 조건을 가진 작업 간 지식 전이를 가능하게 하는 것.
  • 작업의 구조나 고정된 그룹화에 대한 사전 지식 없이도 협동적 MARL 환경에서 학습 효율성과 일반화 능력을 향상시키는 것.
  • 보조 가치 함수 인과분해 목표를 통해 작업 간 공통적인 구조적 패턴을 활용하는 훈련 프레임워크를 개발하는 것.

제안 방법

  • 훈련 중에 관측된 엔티티를 무작위로 분할하여 부분 관측을 시뮬레이션한다.
  • 이미 상상된 하위 그룹 시나리오에서의 유틸리티를 예측하는 가치 함수를 훈련시어, 축구에서의 '브레이크아웃'이나 스타크래프트에서의 유닛 편성과 같은 하위 구조에서 재사용 가능한 패턴을 학습하도록 유도한다.
  • 전체 수익 예측은 상상된 하위 그룹 요소와 외부 영향을 고려한 상호작용 항목의 조합으로 재구성된다.
  • 학습 가능한 마스크를 사용한 어텐션 기반 모델을 활용하여 엔티티 기반 인과분해를 효율적으로 구현한다.
  • 보조 목표로서의 인과분해 가치 함수는 주 가치 함수 손실과 함께 훈련되며, 표현력은 유지하면서 지식 공유를 촉진한다.
  • 하위 그룹이 독립적이거나 최적일 필요는 없으며, 작업 간에 반복되는 하위 구조에서 학습이 가능하다.

실험 결과

연구 질문

  • RQ1엔티티의 랜덤 하위 그룹 인과분해가 다중 작업 다중 에이전트 강화학습에서 일반화 능력을 향상시키는가?
  • RQ2상상된 부분 관측에서 학습하는 것이 다양한 팀 편성 조건 간에 재사용 가능한 행동 패턴을 포착하는 데 얼마나 효과적인가?
  • RQ3랜덤으로 샘플링된 엔티티 하위 그룹에 걸쳐 유틸리티를 인과분해하는 가치 함수가 복잡한 협동적 MARL 환경에서 성능 향상에 얼마나 기여하는가?
  • RQ4제안된 보조 훈련 목표는 모델의 표현력 손실 없이 학습 효율성과 이동 가능성 향상에 기여하는가?

주요 결과

  • REFIL은 다양한 팀 편성 조건을 가진 도전적인 다중 작업 스타크래프트 미크로매니지먼트 환경에서 모든 강력한 기준 모델들을 뛰어넘는 성능을 기록한다.
  • 에이전트와 엔티티의 무작위로 샘플링된 하위 그룹에서 공통 패턴을 학습함으로써 다양한 작업 간 일반화 능력이 향상된다.
  • 보조 인과분해 목표 덕분에 학습 효율성이 향상되어 더 빠른 수렴과 더 나은 샘플 복잡도를 달성한다.
  • 하위 그룹이 완벽하게 독립적이지 않더라도 효과적으로 일반화되며, 비최적의 샘플링에 대한 강건성을 보여준다.
  • 어텐션 기반 마스크의 사용 덕분에 변형된 크기의 입력 환경에서도 엔티티 기반 인과분해를 효율적으로 구현할 수 있다.
  • 실험 결과 모델이 단순한 팀 구성에서 더 복잡한 구성으로의 지식 전이를 가능하게 하며, 반복되는 하위 구조 패턴을 인식함으로써 효과적인 일반화를 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.