Skip to main content
QUICK REVIEW

[논문 리뷰] Accelerating Training in Pommerman with Imitation and Reinforcement Learning

Hardik Meisheri, Omkar Shelke|arXiv (Cornell University)|2019. 11. 12.
Reinforcement Learning in Robotics참고 문헌 27인용 수 7
한 줄 요약

이 논문은 다중 에이전트 Pommerman 환경에서 학습을 가속화하기 위해 유사성 학습과 강화 학습을 융합한 방법을 제안한다. 먼저 Pommerman 개발자들이 제공한 노이즈가 있는 전문가 정책을 모방한 후, 커리큘럼 기반 PPO로 미세조정함으로써, 기존의 비트리 색색 방법보다 훨씬 빠르게 100,000판 이내로 학습을 완료하면서 Skynet(2018 NeurIPS 경쟁에서 두 번째로 뛰어난 에이전트)과의 대결에서 8판 중 7판에서 승리하거나 비기며 뛰어난 성능을 달성하였다.

ABSTRACT

The Pommerman simulation was recently developed to mimic the classic Japanese game Bomberman, and focuses on competitive gameplay in a multi-agent setting. We focus on the 2$ imes$2 team version of Pommerman, developed for a competition at NeurIPS 2018. Our methodology involves training an agent initially through imitation learning on a noisy expert policy, followed by a proximal-policy optimization (PPO) reinforcement learning algorithm. The basic PPO approach is modified for stable transition from the imitation learning phase through reward shaping, action filters based on heuristics, and curriculum learning. The proposed methodology is able to beat heuristic and pure reinforcement learning baselines with a combined 100,000 training games, significantly faster than other non-tree-search methods in literature. We present results against multiple agents provided by the developers of the simulation, including some that we have enhanced. We include a sensitivity analysis over different parameters, and highlight undesirable effects of some strategies that initially appear promising. Since Pommerman is a complex multi-agent competitive environment, the strategies developed here provide insights into several real-world problems with characteristics such as partial observability, decentralized execution (without communication), and very sparse and delayed rewards.

연구 동기 및 목표

  • 유사성 학습과 강화 학습을 융합하여 다중 에이전트 딥 강화 학습의 샘플 비효율성을 줄이기 위해.
  • Pommerman 환경에서의 과제, 즉 부분 관측 가능성, 희박한 보상, 경쟁적 다중 에이전트 환경에서의 비정상성 문제를 해결하기 위해.
  • 유사성 학습에서 강화 학습으로의 전환 과정에서 정책 기억 상실을 방지하는 안정적인 학습 프레임워크를 개발하기 위해.
  • 트리 탐색이 필요 없도록 커리큘럼 학습과 보상 형상화를 통해 수렴 속도를 가속화하기 위해.
  • 다양한 상대방, 즉 향상된 에이전트와 경쟁 기준선에 대해 방법을 평가하기 위해.

제안 방법

  • Pommerman 개발자들이 제공한 노이즈가 있는 전문가 정책을 기반으로 유사성 학습을 통해 기본 게임 메커니즘을 습득한다.
  • 학습 안정화와 원하는 행동과의 보상 일치를 위해 보상 형상화를 적용한 프록시 패러미터 최적화(PPO)로 전환한다.
  • 도메인 특화 히우리스틱 기반 액션 필터를 적용하여 열악한 행동을 억제하고 정책 안정성을 향상시킨다.
  • 학습 중 노이즈가 있거나 일관되지 않은 관측을 처리하기 위해 저자극 보정을 구현한다.
  • 초기에는 정적이고 단순한 에이전트부터 시작하여 점진적으로 상대의 난이도를 높이는 방식으로 커리큘럼 학습을 구현한다.
  • 저자극 보정과 액션 필터링을 모두 적용한 병합된 PPO 에이전트를 사용하여 내구성과 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1노이즈가 있는 전문가 정책에 대한 유사성 학습이 Pommerman과 같은 복잡한 다중 에이전트 환경에서 정책 학습을 효과적으로 부트스트랩할 수 있는가?
  • RQ2유사성 학습에서 강화 학습으로의 전환 과정에서 기본 기술을 상실하는 치명적인 기억 상실을 방지하기 위해 어떻게 안정화할 수 있는가?
  • RQ3커리큘럼 학습이 다중 에이전트 Pommerman 학습에서 수렴 속도를 얼마나 가속화하고 최종 성능을 향상시키는가?
  • RQ4보상 형상화, 액션 필터링, 저자극 보정이 정책 안정성과 승률에 어떤 영향을 미치는가?
  • RQ5순수한 강화 학습 및 히우리스틱 기반 기준선과 비교했을 때 제안된 방법은 성능과 샘플 효율성 측면에서 어떻게 다른가?

주요 결과

  • PPO 에이전트는 2018 NeurIPS 경쟁에서 두 번째로 뛰어난 에이전트인 Skynet과의 대결에서 8판 중 7판에서 승리하거나 비겼다.
  • 기존의 비트리 색색 방법과 비교해 학습 시간을 100,000판으로 크게 단축시켰다.
  • 저자극 보정과 액션 필터링을 모두 적용함으로써 모든 상대에 대해 패널스와 비기수를 감소시키고, 모든 경우에서 승수를 증가시켰다.
  • 초기에는 간단한 상대와 먼저 학습함으로써 더 나은 탐색과 폭탄 배치 전략을 확보했으며, 이는 유사성 학습을 통해 습득한 기본 기술의 상실을 방지했다.
  • 저자극 보정과 액션 필터링을 모두 적용한 PPO 에이전트는 StaticAgent와의 대결에서 90.4%의 승률을 기록했고, 순수한 PPO는 68.1%에 머물렀다. 이는 수정 사항의 효과를 입증한다.
  • 민감도 분석 결과, 초기에는 유망해 보였지만 결국 성능 저하를 초래한 전략(예: 필터 없이 유사성 학습)이 존재함을 확인했으며, 이는 철저한 하이퍼파rameter 튜닝의 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.