[논문 리뷰] Skynet: A Top Deep RL Agent in the Inaugural Pommerman Team Competition
이 논문은 2018년도 Pommerman 팀 경쟁 대회에서 최고 성능을 기록한 딥 강화학습 에이전트인 Skynet955를 제시한다. 이 에이전트는 특히 자살 폭탄 배치를 포함한 위험한 행동을 제거하는 새로운 ActionFilter 모듈을 사용하여 더 효율적인 탐색과 훈련을 가능하게 하였으며, PPO 기반 훈련, 보상 형태 조정, 자기 대전 상대에 대한 커리큘럼 학습을 결합하였다. 이로 인해 '학습 에이전트' 부문에서 2위를 기록하였다.
The Pommerman Team Environment is a recently proposed benchmark which involves a multi-agent domain with challenges such as partial observability, decentralized execution (without communication), and very sparse and delayed rewards. The inaugural Pommerman Team Competition held at NeurIPS 2018 hosted 25 participants who submitted a team of 2 agents. Our submission nn_team_skynet955_skynet955 won 2nd place of the "learning agents'' category. Our team is composed of 2 neural networks trained with state of the art deep reinforcement learning algorithms and makes use of concepts like reward shaping, curriculum learning, and an automatic reasoning module for action pruning. Here, we describe these elements and additionally we present a collection of open-sourced agents that can be used for training and testing in the Pommerman environment. Code available at: https://github.com/BorealisAI/pommerman-baseline
연구 동기 및 목표
- 부분 관측 가능하고 보상이 희박한 Pommerman 환경에서 분산 실행이 가능한 강력한 다중 에이전트 딥 강화학습 에이전트를 개발하기 위해.
- 다중 에이전트 환경에서 지연된 보상, 오해의 보상 할당, 부분 관측 가능성을 다루기 위해.
- 행동 필터링 메커니즘을 통해 사전 지식을 통합하여 샘플 효율성과 학습 안정성을 향상시키기 위해.
- 커리큘럼 학습과 다양한 훈련 상대를 통해 다양한 상대 유형에 대한 일반화를 가능하게 하기 위해.
- Pommerman 환경에서의 벤치마킹과 훈련을 위해 오픈소스 에이전트 세트를 공개하기 위해.
제안 방법
- 딥 강화학습을 위해 Proximal Policy Optimization (PPO)로 훈련된 신경망 정책을 사용하였다.
- 수동으로 정의된 규칙을 사용하여 불법 및 자살 행동(예: 자폭으로 이어지는 폭탄 배치)을 제거하는 ActionFilter 모듈을 구현하였다.
- 약한 상대(예: SmartRandomNoBomb)로부터 시작하여 점차 강한 상대로 전환하는 커리큘럼 학습을 적용하였다.
- 안전하고 전략적인 행동(예: 자가 피해를 피하고 적의 제거를 우선시하는 것)을 장려하기 위해 보상 형태 조정을 적용하였다.
- 에이전트를 V0 환경(벽 붕괴 없음)에서만 훈련하고, 경쟁 대회에서 사용된 V1 버전(동적 벽 붕괴 있음)에서 평가하였다.
- 훈련 및 평가를 위해 StaticAgent, SmartRandom, SmartRandomNoBomb, CautiousAgent 등의 에이전트 모음의 오픈소스 공개를 수행하였다.
실험 결과
연구 질문
- RQ1규칙 기반 필터링을 통한 행동 정제가 보상이 희박하고 부분 관측 가능한 다중 에이전트 환경에서 샘플 효율성과 학습 안정성 향상에 어떻게 기여하는가?
- RQ2다양한 상대 유형에 대한 커리큘럼 학습이 Pommerman 팀 설정에서 일반화 능력과 최종 성능 향상에 얼마나 기여하는가?
- RQ3간소화된 환경(V0)에서 훈련된 딥 강화학습 에이전트가 동적 벽 붕괴가 있는 더 복잡한 환경(V1)으로 일반화될 수 있는가?
- RQ4사전 지식(예: 자살 방지)의 통합이 자기 대전 훈련에서 전략적 행동의 도출에 어떻게 영향을 미치는가?
- RQ5상대 다양성이 과적합 방지 및 훈련된 정책의 강건성 향상에 어떤 역할을 하는가?
주요 결과
- Skynet955 에이전트는 NeurIPS 2018 Pommerman 팀 경쟁의 '학습 에이전트' 부문에서 2위를 기록하였다.
- ActionFilter 모듈은 불법 및 자살 행동을 제거하여 행동 공간을 줄였으며, 이로 인해 훈련의 안정성과 샘플 효율성이 크게 향상되었다.
- SimpleAgent 상대 팀에 대해 70%의 승률을 기록했지만, CautiousAgent 상대 팀에 대해서는 약 10%의 승률을 기록하여 일반화 문제를 드러내었다.
- SmartRandomNoBomb와 같은 약한 상대로부터 시작하는 커리큘럼 학습은 더 나은 최종 성능과 강건성을 향상시켰다.
- 오픈소스로 공개된 에이전트, 특히 SmartRandomNoBomb와 CautiousAgent는 RL 에이전트 훈련을 위한 강력하고 탐색에 취약하지 않은 상대로 효과적으로 기능하였다.
- V0 환경(벽 붕괴 없음)에서 훈련되었음에도 불구하고 V1 환경(벽 붕괴 있음)에서 합리적인 성능을 보였으며, 이는 특정 조건 하에서 학습된 정책의 이행 가능성(transferability)을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.