[논문 리뷰] Variational Automatic Curriculum Learning for Sparse-Reward Cooperative Multi-Agent Problems
이 논문은 희박 보상 협동 다중에이전트 강화학습을 위한 변분 추론 기반 커리큘럼 학습 프레임워크인 Variational Automatic Curriculum Learning (VACL)을 제안한다. 학습 목표를 정책 최적화와 작업 분포 갱신으로 분해함으로써, VACL은 작업 확장과 엔티티 진행을 통해 계층적 학습 커리큘럼을 자동으로 생성하며, 단일 데스크톱 머신에서 100에이전트 간단스프레드에서 98% 커버리지 달성과 함께 히드-앤드-시크에서 램프 사용과 같은 복잡한 행동 재현을 가능하게 한다.
We introduce a curriculum learning algorithm, Variational Automatic Curriculum Learning (VACL), for solving challenging goal-conditioned cooperative multi-agent reinforcement learning problems. We motivate our paradigm through a variational perspective, where the learning objective can be decomposed into two terms: task learning on the current task distribution, and curriculum update to a new task distribution. Local optimization over the second term suggests that the curriculum should gradually expand the training tasks from easy to hard. Our VACL algorithm implements this variational paradigm with two practical components, task expansion and entity progression, which produces training curricula over both the task configurations as well as the number of entities in the task. Experiment results show that VACL solves a collection of sparse-reward problems with a large number of agents. Particularly, using a single desktop machine, VACL achieves 98% coverage rate with 100 agents in the simple-spread benchmark and reproduces the ramp-use behavior originally shown in OpenAI's hide-and-seek project. Our project website is at https://sites.google.com/view/vacl-neurips-2021.
연구 동기 및 목표
- 큰 수의 에이전트를 포함한 희박 보상 환경에서 협동 다중에이전트 정책을 훈련하는 데 도전하는 데 대비하기 위해.
- 작업 난이도를 점진적으로 조정하는 스케일러블하고 자동화된 커리큘럼 학습 프레임워크를 개발하기 위해.
- 변분 추론을 활용해 작업 구성과 에이전트/객체 수 모두에 걸쳐 커리큘럼 생성을 통합하기 위해.
- 보상 형상화 없이도 복잡한 다중에이전트 환경에서 샘플 효율적이고 고성능의 학습을 가능하게 하기 위해.
- 단일 데스크톱 머신을 사용하여 히드-앤드-시크에서 램프 사용과 같은 급성장 행동을 재현하기 위해.
제안 방법
- MARL 목표를 변분 추론 문제로 재구성하여 정책 개선과 작업 분포 갱신 항목으로 분해한다.
- 커리큘럼 학습 기간 동안 작업 분포를 전체 작업 공간으로 효율적으로 확장하기 위해 스틸 변분 경사 하강법(SVGD)을 사용한다.
- 에이전트나 물체 수를 점진적으로 증가시키는 엔티티 진행을 도입하여, 더 큰 시스템이 훈련하기 더 어려운 것을 통찰력으로 활용한다.
- 이산 변수(예: 에이전트 수)에 연속적 근사화를 적용하여 엔드 투 엔드로 미분 가능한 커리큘럼 학습을 가능하게 한다.
- 정책 최적화와 변분 제안 갱신을 통한 커리큘럼 갱신을 번갈아 수행하는 이중 단계 훈련 루프를 구현한다.
- 동일한 목표 조건 정책을 동일한 성격의 에이전트들 간에 공유하며, PPO를 활용한 오프-폴리시 딥 강화학습으로 훈련한다.
실험 결과
연구 질문
- RQ1협동 다중에이전트 강화학습을 위한 원리적인 커리큘럼 학습 알고리즘을 도출하기 위해 변분 추론 프레임워크를 사용할 수 있는가?
- RQ2다중에이전트 환경에서 작업 구성과 에이전트 수 모두에 걸쳐 자동으로 커리큘럼 학습을 생성할 수 있는가?
- RQ3해당 커리큘럼가 희박 보상, 고차원 다중에이전트 환경에서 샘플 효율적인 훈련을 가능하게 하는가?
- RQ4제안된 방법이 협동 다중에이전트 환경에서 램프 사용과 같은 복잡한 급성장 행동을 재현할 수 있는가?
- RQ5단일 데스크톱 머신과 희박 보상 조건에서 100명 이상의 에이전트로 확장 가능한가?
주요 결과
- VACL은 단일 데스크톱 머신과 희박 보상만을 사용하여 100에이전트 간단스프레드 벤치마크에서 98% 커버리지 비율을 달성한다.
- 이 방법은 오픈AI의 히드-앤드-시크 프로젝트에서 관찰된 램프 사용 행동을 성공적으로 재현하여 복잡한 협동 행동의 급성장 가능성을 입증한다.
- 락 앤 레이턴스 챌린지에서 VACL은 90% 이상의 성공률을 기록하며, 동일한 훈련 예산 조건에서 모든 베이스라인보다 뛰어나며, 15%를 초과하지 못했다.
- MPE 및 MuJoCo 기반 히드-앤드-시크 환경 전반에서 VACL은 훈련 속도와 최종 성능 모두에서 모든 베이스라인을 압도적으로 앞선다.
- 작업 확장과 엔티티 진행의 조합은 수동 커리큘럼 설계 없이도 효과적인 계층적 커리큘럼 학습을 가능하게 한다.
- 이산 변수의 연속적 근사화는 에이전트 수에 걸친 원활한 커리큘럼 학습을 가능하게 하며, 다양한 시스템 크기 간 통합 훈련을 실현한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.