[논문 리뷰] Dealing with Non-Stationarity in MARL via Trust-Region Decomposition
이 논문은 공동 다에이전트 강화 학습(MARL)에서 비정상성(non-stationarity)을 완화하기 위해 메시지 전달 네트워크(TRD-Net)를 통해 연합 정책 제약 조건을 분해함으로써 연합 정책 분리도를 정확하게 추정하는 trust-region 기반의 다에이전트 강화 학습 알고리즘인 MAMT를 제안한다. 종료형으로 지역 trust 영역을 적응적으로 조정함으로써 MAMT는 다양한 공동 작업 환경에서 안정적이고 뚜렷한 성능 향상을 달성하며, 밀도 높은 보상 환경에서 기준 모델보다 최대 25.04 ± 1.68만큼 뛰어난 성능을 기록한다.
Non-stationarity is one thorny issue in cooperative multi-agent reinforcement learning (MARL). One of the reasons is the policy changes of agents during the learning process. Some existing works have discussed various consequences caused by non-stationarity with several kinds of measurement indicators. This makes the objectives or goals of existing algorithms are inevitably inconsistent and disparate. In this paper, we introduce a novel notion, the $δ$-measurement, to explicitly measure the non-stationarity of a policy sequence, which can be further proved to be bounded by the KL-divergence of consecutive joint policies. A straightforward but highly non-trivial way is to control the joint policies' divergence, which is difficult to estimate accurately by imposing the trust-region constraint on the joint policy. Although it has lower computational complexity to decompose the joint policy and impose trust-region constraints on the factorized policies, simple policy factorization like mean-field approximation will lead to more considerable policy divergence, which can be considered as the trust-region decomposition dilemma. We model the joint policy as a pairwise Markov random field and propose a trust-region decomposition network (TRD-Net) based on message passing to estimate the joint policy divergence more accurately. The Multi-Agent Mirror descent policy algorithm with Trust region decomposition, called MAMT, is established by adjusting the trust-region of the local policies adaptively in an end-to-end manner. MAMT can approximately constrain the consecutive joint policies' divergence to satisfy $δ$-stationarity and alleviate the non-stationarity problem. Our method can bring noticeable and stable performance improvement compared with baselines in cooperative tasks of different complexity.
연구 동기 및 목표
- 다른 에이전트의 정책 변화로 인해 학습이 불안정해지는 공동 다에이전트 강화 학습(MARL)에서의 비정상성 문제를 해결한다.
- 기존 trust-region 방법의 한계를 극복한다. 즉, 연합 정책을 제약하는 것은 실현 가능하지 않으며, 단순한 정책 분해는 높은 분리도를 유도한다.
- 연속된 연합 정책 간의 KL-발산에 의해 이론적으로 경계되는, 정책 시퀀스 비정상성의 명시적 측정을 위한 새로운 $δ$-정상성 지표를 도입한다.
- 직접적인 연합 정책 최적화 없이도, 분해된 trust-region 제약 조건을 통해 연합 정책 분리도를 정확하고 확장 가능한 방법으로 추정하는 방법을 개발한다.
- 지역 trust 영역을 적응적으로 조정하여 $δ$-정상성을 유지하고 샘플 효율성 및 성능을 향상시키는 종료형 학습 프레임워크를 구축한다.
제안 방법
- 비정상성에 대한 원칙적인 측정과 경계를 제공하는 새로운 $δ$-정상성 지표를 제안한다. 이는 상대방 전환 비용을 기반으로 하며, 연속된 연합 정책 간의 KL-발산에 의해 이론적으로 경계된다.
- 정확한 연합 정책 분리도 추정을 위해 연합 정책을 쌍별 마르코프 무작위 필드로 모델링하여 구조적 메시지 전달을 가능하게 한다.
- TRD-Net을 설계하여, 지역 정책 업데이트를 기반으로 연속된 연합 정책 간의 KL 발산을 추정하는 메시지 전달 신경망을 구현한다.
- TRD-Net을 trust-region 프레임워크에 통합하여 각 에이전트의 지역 정책 trust 영역에 대한 적응적 조율 계수를 계산한다.
- MAMT(Multi-Agent Mirror descent with Trust-region Decomposition)를 개발하여, TRD-Net 출력에 기반해 지역 trust 영역을 조정하는 종료형 알고리즘을 구현한다.
- 기본 정책 업데이트 규칙으로 Proximal Policy Optimization(PPO)를 사용하며, 학습된 조율 계수를 통해 각 에이전트에 대해 trust-region 제약 조건을 적용한다.
실험 결과
연구 질문
- RQ1비정상성은 원칙적인 지표를 통해 어떻게 공식적으로 측정되고 경계될 수 있는가?
- RQ2직접적인 연합 최적화 없이도, 분해된 지역 정책 제약 조건을 통해 연합 정책 분리도를 정확하게 추정할 수 있는가?
- RQ3적응적 조율 계수를 사용한 trust-region 분해가 고정 또는 무작위 제약 조건보다 정책 안정성을 유지하는 데 더 우수한가?
- RQ4trust-region 파rameter의 종료형 학습이 공동 다에이전트 강화 학습 과제에서 샘플 효율성과 성능 향상에 기여하는가?
- RQ5다양한 복잡도의 과제에서 제안된 방법이 기준 모델 대비 안정성, 수렴 속도 및 최종 성능 측면에서 어떻게 비교되는가?
주요 결과
- MAMT는 네 가지 공동 작업 과제 전반에서 최고의 성능를 기록하였으며, Rover-Tower 환경에서 최종 수익이 25.04 ± 1.68로 MAMT-PPO 및 기타 아블레이션 변형보다 뚜렷하게 뛰어나다.
- MAMT-PPO에 도달하는 데 필요한 에피소드 수의 약 절반으로 동일한 성능에 도달함으로써, 더 뛰어난 샘플 효율성을 입증한다.
- 조율 계수를 무작위로 설정한 MAMT-Random은 성능이 심각하게 악화되어, 학습된 적응적 trust-region 제어의 필요성을 확인한다.
- 고정된 조율 계수를 설정한 MAMT-Fixed는 MAMT 수준의 성능을 기록하며, TRD-Net이 지역 trust 영역과 연합 정책 분리도 사이의 최적 관계를 효과적으로 학습하고 있음을 시사한다.
- KL-발산의 가중합 근사(이하 MAMT-WS)는 복잡한 과제에서 높은 분산과 열악한 성능를 보이며, 단순한 분해 방법의 불안정성을 드러낸다.
- KL-발산 곡선(그림 16–19)은 MAMT가 MAAC보다 유의미하게 낮고 안정적인 연합 정책 분리도를 유지하고 있음을 확인하며, 정책 안정성 향상을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.