[논문 리뷰] Weighted Double Deep Multiagent Reinforcement Learning in Stochastic Cooperative Environments
이 논문은 비정상성과 확률성을 다루기 위해 가중 이중 Q-학습 추정기와 유연한 보상 네트워크, 스케줄링된 리플레이 전략을 조합한 다중에이전트 딥 강화학습 프레임워크인 가중 이중 딥 Q-네트워크(WDDQN)를 제안한다. WDDQN은 특히 복잡하고 시각적으로 풍부하며 확률적인 환경에서 DDQN과 유연한 Q-학습보다 더 빠른 수렴 속도와 더 높은 평균 보상을 달성한다.
Recently, multiagent deep reinforcement learning (DRL) has received increasingly wide attention. Existing multiagent DRL algorithms are inefficient when facing with the non-stationarity due to agents update their policies simultaneously in stochastic cooperative environments. This paper extends the recently proposed weighted double estimator to the multiagent domain and propose a multiagent DRL framework, named weighted double deep Q-network (WDDQN). By utilizing the weighted double estimator and the deep neural network, WDDQN can not only reduce the bias effectively but also be extended to scenarios with raw visual inputs. To achieve efficient cooperation in the multiagent domain, we introduce the lenient reward network and the scheduled replay strategy. Experiments show that the WDDQN outperforms the existing DRL and multiaent DRL algorithms, i.e., double DQN and lenient Q-learning, in terms of the average reward and the convergence rate in stochastic cooperative environments.
연구 동기 및 목표
- 협동 다중에이전지 강화학습 환경에서의 비정상성과 확률성 문제를 해결한다.
- 원시 시각 입력을 가진 다중에이전지 설정에서 기존의 딥 Q-네트워크(DQN)와 이중 딥 Q-네트워크(DDQN)의 불안정성과 열악한 수렴 성능을 극복한다.
- 가중 이중 추정기와 우선순위 경험 재현과 같은 고급 구성 요소를 통합하여 학습 효율성과 정책 품질을 향상시킨다.
- 다른 에이전트의 행동이나 보상을 관찰하지 않더라도 공통의 수익을 최대화하면서 독립적 학습자가 효과적으로 협력할 수 있도록 한다.
- 다중에이전지 역학에 맞는 보조 메커니즘을 통해 고차원적이고 확률적인 환경에서 학습을 안정화한다.
제안 방법
- 단일에이전트 RL에서 유래한 가중 이중 Q-학습(WDQ) 추정기를 다중에이전지 딥 강화학습 영역으로 확장하여 Q-값 과대평가 편향을 줄인다.
- 노이즈가 많거나 최적화되지 않은 즉각적 보상을 민감하게 반응하는 것을 방지하기 위해 보상 신호를 부드럽게 하는 유연한 보상 네트워크(LRN)를 도입한다.
- 학습 안정성과 수렴 속도를 향상시키기 위해 리플레이 우선순위를 동적으로 조정하는 스케줄링된 리플레이 전략(SRS)을 제안한다.
- 가중 이중 추정기를 딥 신경망과 통합하여 원시 시각 관측치와 큰 상태 공간을 처리한다.
- 다중에이전지 설정에 적합하도록 우선순위 경험 재현을 수정하여 비정상적인 정책 하에서도 안정적인 학습을 보장한다.
- 공통의 보상 함수를 공유하지만 서로의 행동을 관찰하지 않는 독립적 학습자(ILs)를 사용하여 확장 가능한 협력을 가능하게 한다.
실험 결과
연구 질문
- RQ1단일에이전트 RL에서 유래한 가중 이중 추정기는 협동 다중에이전지 딥 강화학습에 효과적으로 확장될 수 있는가?
- RQ2유연한 보상 네트워크는 확률적인 협동 환경에서 학습 안정성과 수렴 성능을 어떻게 향상시키는가?
- RQ3스케줄링된 리플레이 전략은 원시 시각 입력을 가진 다중에이전지 DRL에서 학습 속도와 정책 품질을 얼마나 향상시키는가?
- RQ4WDQ, LRN, SRS를 통합한 WDDQN은 평균 보상과 수렴 속도 측면에서 DDQN과 유연한 Q-학습보다 우수한 성능을 내는가?
- RQ5WDDQN은 확률적 보상과 큰 상태 공간을 가진 환경에서 최적의 협동 정책을 안정적으로 학습할 수 있는가?
주요 결과
- WDDQN은 평균 보상 측면에서 DDQN과 유연한 Q-학습을 능가하며, 이중 예측자 사냥 과제에서 안정적인 평균 수익 80을 달성하여 최적 정책에 해당한다.
- 유연한 보상 네트워크와 스케줄링된 리플레이를 제외한 WDDQN 변종(WDDQN w.o. LRN+SRS)는 광범위한 훈련 후에도 수렴하지 못해 두 보조 구성 요소의 필수성을 입증한다.
- LRN과 SRS를 모두 포함한 WDDQN은 다른 변종보다 더 빠르고 안정적으로 수렴하여 제안된 메커니즘 간의 상호보완 효과를 입증한다.
- 유연한 보상 네트워크는 특히 확률적 보상을 가진 환경에서 더 빠른 협력 수립과 비최적 정책으로의 조기 수렴을 감소시킨다.
- Pac-Man 환경에서 WDDQN은 DDQN과 WDDQN w.o. LRN+SRS에 비해 상당히 향상된 수렴 속도와 안정성을 보였다.
- 실험 결과는 WDDQN이 확률성과 비정상성에 강건하며, 복잡한 협동 과제에서 다수의 실행에 걸쳐 일관된 성능을 달성함을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.