[논문 리뷰] Regret Bounds for Decentralized Learning in Cooperative Multi-Agent Dynamical Systems
이 논문은 부분적 시스템 지식과 제한된 통신을 가진 협동적 선형-제곱(LQ) 동적 시스템을 위한 탈중앙화된 다중 에이전트 강화학습(MARL) 알고리즘을 제안한다. 보조 단일 에이전트 LQ 문제를 구축하여 암묵적 협조 메커니즘을 제공함으로써, 한 에이전트만 미지의 동역학을 가지며 통신이 단방향인 경우에도 $\tilde{O}(\sqrt{T})$의 리그레트 한계를 달성한다. 이는 단일 에이전트 LQ 제어 이론적 성능 한계와 일치한다.
Regret analysis is challenging in Multi-Agent Reinforcement Learning (MARL) primarily due to the dynamical environments and the decentralized information among agents. We attempt to solve this challenge in the context of decentralized learning in multi-agent linear-quadratic (LQ) dynamical systems. We begin with a simple setup consisting of two agents and two dynamically decoupled stochastic linear systems, each system controlled by an agent. The systems are coupled through a quadratic cost function. When both systems' dynamics are unknown and there is no communication among the agents, we show that no learning policy can generate sub-linear in $T$ regret, where $T$ is the time horizon. When only one system's dynamics are unknown and there is one-directional communication from the agent controlling the unknown system to the other agent, we propose a MARL algorithm based on the construction of an auxiliary single-agent LQ problem. The auxiliary single-agent problem in the proposed MARL algorithm serves as an implicit coordination mechanism among the two learning agents. This allows the agents to achieve a regret within $O(\sqrt{T})$ of the regret of the auxiliary single-agent problem. Consequently, using existing results for single-agent LQ regret, our algorithm provides a $ ilde{O}(\sqrt{T})$ regret bound. (Here $ ilde{O}(\cdot)$ hides constants and logarithmic factors). Our numerical experiments indicate that this bound is matched in practice. From the two-agent problem, we extend our results to multi-agent LQ systems with certain communication patterns.
연구 동기 및 목표
- 미지의 시스템 동역학과 제한된 통신 조건 하에서 탈중앙화된 다중 에이전트 강화학습(MARL)의 리그레트 분석 문제를 다루는 것.
- 양쪽 에이전트가 시스템 동역학을 모두 모른다는 조건에서 통신이 없을 경우 리그레트 성능의 기본 한계를 규명하는 것.
- 부분적 시스템 지식과 비대칭 정보 흐름이 존재하는 상황에서 서브-선형 리그레트를 달성하는 MARL 알고리즘을 설계하는 것.
- 제안된 프레임워크를 구조화된 통신 패턴을 가진 다중 에이전트 LQ 시스템으로 확장하는 것.
제안 방법
- 두 탈중앙화된 에이전트 간의 암묵적 협조 메커니즘으로서 보조 단일 에이전트 LQ 문제를 구성한다.
- 미지의 시스템을 제어하는 에이전트에서 다른 에이전트로의 단방향 통신을 활용하여 공동 학습을 가능하게 한다.
- 리그레트를 탈중앙화된 MARL 정책 하에서의 비용과 시스템 파rameter를 완전히 알고 있는 최적의 비용 간 누적 차이로 정의한다.
- 기존의 단일 에이전트 LQ 리그레트 한계(예: Abbasi-Yadkori & Szepesvári, 2011)를 활용하여 MARL 알고리즘의 리그레트 한계를 유도한다.
- 다중 에이전트 시스템을 중심화된 보조 문제로 변환하여 학습과 제어 정책 설계를 분리한다.
- 상태 추정 오차 동역학과 트레이스 기반의 경계를 사용하여 MARL 알고리즘의 리그레트를 보조 단일 에이전트 문제의 리그레트와 연결한다.
실험 결과
연구 질문
- RQ1양쪽 에이전트가 시스템 동역학을 모두 모른다는 조건에서 통신이 허용되지 않는 경우, 탈중앙화된 MARL에서 서브-선형 리그레트를 달성할 수 있는가?
- RQ2단방향 통신과 부분적 시스템 지식을 가진 이중 에이전트 협동적 LQ 시스템에서의 기본 리그레트 한계는 무엇인가?
- RQ3보조 단일 에이전트 LQ 문제를 어떻게 활용하여 다중 에이전트 시스템 내의 두 탈중앙화된 에이전트를 암묵적으로 조율할 수 있는가?
- RQ4단일 에이전트 LQ 학습 알고리즘의 리그레트를 사용하여 탈중앙화된 MARL 알고리즘의 리그레트를 경계할 수 있는가?
- RQ5구조화된 통신 패턴은 다중 에이전트 LQ 시스템에서 리그레트 성능에 어떤 영향을 미치는가?
주요 결과
- 양쪽 에이전트가 시스템 동역학을 모두 모른다는 조건에서 통신이 없을 경우, 어떤 학습 정책도 $T$에 대해 서브-선형 리그레트를 달성할 수 없으며, 리그레트는 최소 선형 수준에 머무른다.
- 미지의 시스템을 제어하는 에이전트에서 다른 에이전트로의 단방향 통신이 가능할 경우, 제안된 MARL 알고리즘이 $\tilde{O}(\sqrt{T})$의 리그레트 한계를 달성한다.
- MARL 알고리즘의 리그레트는 보조 단일 에이전트 LQ 문제의 리그레트에 더해 추정 오차로 인한 $O(\sqrt{T})$ 비례 항으로 제한된다.
- 수치 실험을 통해 이론적 $\tilde{O}(\sqrt{T})$ 리그레트 한계가 실질적으로도 달성됨을 확인하였다.
- 양방향 통신이 가능하고 양쪽 에이전트가 시스템 동역학을 모두 모를 경우, MARL 알고리즘의 리그레트는 보조 단일 에이전트 LQ 문제의 리그레트와 동일하며, $R(T,\texttt{AL-MARL3}) = R^\diamond(T,\texttt{AL-SARL})$를 만족한다.
- 이 방법은 특정 통신 패턴을 가진 다중 에이전트 LQ 시스템으로 일반화되며, 적절한 가정 하에 $\tilde{O}(\sqrt{T})$ 리그레트를 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.