Skip to main content
QUICK REVIEW

[논문 리뷰] Continual Match Based Training in Pommerman: Technical Report

Peng Peng, Liang Pang|arXiv (Cornell University)|2018. 12. 18.
Domain Adaptation and Few-Shot Learning참고 문헌 7인용 수 10
한 줄 요약

이 논문은 시연 또는 모방 없이 Pommerman 에이전트를 훈련시키기 위한 지속적 일치 기반 훈련 프레임워크인 COMBAT를 제안한다. 라운드-robin 일정, 동적 ELO 기반 순위 매기기, 적응형 할인 요소 조정을 통해, 에이전트는 기존에 습득한 지식을 유지하면서도 새로운 기술—예를 들어 폭탄 밀기 및 파wr업 수집—을 지속적으로 학습할 수 있으며, 이는 NeurIPS 2018 경연 대회에서 상위 1위 에이전트를 달성하는 데 기여한다.

ABSTRACT

Continual learning is the ability of agents to improve their capacities throughout multiple tasks continually. While recent works in the literature of continual learning mostly focused on developing either particular loss functions or specialized structures of neural network explaining the episodic memory or neural plasticity, we study continual learning from the perspective of the training mechanism. Specifically, we propose a COnitnual Match BAsed Training (COMBAT) framework for training a population of advantage-actor-critic (A2C) agents in Pommerman, a partially observable multi-agent environment with no communication. Following the COMBAT framework, we trained an agent, namely, Navocado, that won the title of the top 1 learning agent in the NeurIPS 2018 Pommerman Competition. Two critical features of our agent are worth mentioning. Firstly, our agent did not learn from any demonstrations. Secondly, our agent is highly reproducible. As a technical report, we articulate the design of state space, action space, reward, and most importantly, the COMBAT framework for our Pommerman agent. We show in the experiments that Pommerman is a perfect environment for studying continual learning, and the agent can improve its performance by continually learning new skills without forgetting the old ones. Finally, the result in the Pommerman Competition verifies the robustness of our agent when competing with various opponents.

연구 동기 및 목표

  • 희미한 보상이 있는 부분 관찰 가능한 환경에서 다중 에이전트 강화 학습을 위한 확장 가능하고 재현 가능한 훈련 프레임워크 개발.
  • Pommerman과 같은 복잡한 환경에서 반응형 및 장기적 계획 기술을 학습하면서 이전 지식을 잊지 않는 지속적 기술 습득의 과제 해결.
  • 시연에 의존하지 않고 경쟁 기반의 일치 훈련을 통해 자가 향상이 가능한 환경 조성.
  • 특히 할인 요소와 같은 동적 하이퍼파ram터 적응이 POMDP에서 局부 최적값을 벗어나 학습을 연장하는 데 어떻게 기여하는지 조사.
  • NeurIPS 2018 Pommerman 경연에서 다양한 상대방과의 경쟁을 통해 프레임워크의 견고성 검증.

제안 방법

  • 병렬로 훈련되는 A2C 에이전트의 집단을 구현하고, 라운드-robin 토너먼트 구조에 기반한 매치 스케줄링을 적용.
  • 매치 결과에 기반해 ELO 스코어를 사용해 에이전트 순위를 매기고, 상위 성능을 낸 에이전트만 계속 훈련에 참여하도록 유도.
  • 수렴한 에이전트의 할인 요소(핵심 하이퍼파ram터)를 동적으로 업데이트하여 새로운 행동 정책 탐색을 가능하게 한다.
  • 복잡성 점진적 도입: 단일 에이전트 훈련에서 시작하여 팀 훈련으로 전환하고, 마지막으로 폭탄 밀기 행동 활성화.
  • 보상 함수의 교육과정 설계: 기본 생존 보상부터 시작하여 파워업 수집 보상 추가, 마지막으로 팀 협업 고려.
  • 다단계 훈련 파이프라인 적용: (1) 기본 보상으로 단일 에이전트 훈련, (2) 파워업 보너스 포함, (3) 밀기 기능 비활성화 상태에서 팀 훈련, (4) 밀기 기능 활성화, 점진적 기술 습득 가능.

실험 결과

연구 질문

  • RQ1시연 없이도 일치 기반, 인구 기반 훈련 프레임워크가 부분 관찰 가능하고 다중 에이전트 환경에서 지속적 학습을 가능하게 할 수 있는가?
  • RQ2특히 할인 요소와 같은 동적 하이퍼파ram터 조정이 어떻게 국부 최적값을 벗어나 고급 기술을 학습하는 데 기여하는가?
  • RQ3경쟁 환경에서 지속적 훈련을 통해 새로운 기술을 습득하면서도 이전에 습득한 기술을 얼마나 잘 유지할 수 있는가?
  • RQ4통신 부재와 부분 관찰 가능성의 존재가 복잡한 협력적 및 경쟁적 행동의 탄생을 방해하는가, 아니면 촉진하는가?
  • RQ5자기 향상 기반의 훈련 프레임워크가 실세계 경쟁 환경인 NeurIPS 2018 Pommerman 경쟁에서 표준 RL 기준 모델을 능가할 수 있는가?

주요 결과

  • COMBAT 프레임워크 덕분에 Navocado 에이전트는 시연을 전혀 사용하지 않고도 NeurIPS 2018 Pommerman 경연에서 상위 1위를 달성했다.
  • 에이전트는 점진적 기술 습득을 보였다: 기본 생존 및 파워업 수집에서 시작해 폭탄 밀기 및 전략적 위치 선정과 같은 고급 행동으로 전환.
  • 최종 훈련 단계에서 게임 에피소드 길이가 약 500에서 약 400 단계로 감소하여, 공격 및 협업 능력을 향상시키며 더 효율적이고 공격적인 플레이가 가능해졌음을 시사.
  • 폭탄 폭발의 폭발 지점 근처에 머물러 폭발을 피하는 행동을 학습하여 반응형 생존 행동을 보였다.
  • 적의 폭탄을 적대자 쪽으로 밀어내 폭발을 전략적 무기로 활용하는 행동을 학습하여 전략적 사고 능력을 보였다.
  • 목재 벽 근처에 폭탄을 놓는 기본 기술이 조기에 습득되면 이후 하이퍼파ram터 조정에도 불구하고 유지되었지만, 초기에 습득하지 못하면 나중에 다시 습득하기 어려웠으며, 이는 기본 기술에 대한 임계 학습 창문이 존재함을 시사.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.