Skip to main content
QUICK REVIEW

[논문 리뷰] Scalable Multi-agent Covering Option Discovery based on Kronecker Graphs

Jiayu Chen, Jingdi Chen|arXiv (Cornell University)|2023. 07. 21.
Reinforcement Learning in RoboticsComputer Science인용 수 3
한 줄 요약

이 논문은 다중 에이전트 강화 학습(MARL)에서 상태 공간의 기하급수적 증가와 희박한 보상 문제를 해결하기 위해, 개별 에이전트 전이 그래프의 크로네커乘을 이용해 공동 상태 공간을 근사하는 확장 가능한 다중 에이전트 옵션 탐색 방법을 제안한다. 이는 공동 커버링 옵션을 구성하기 위해 페일러 벡터(Fiedler vector)를 효율적으로 추정할 수 있도록 하며, 다중 에이전트 탐색을 크게 향상시킨다. 제안된 방법은 다중 에이전트 그리드 미로 및 머지코 환경과 같은 복잡한 작업에서 단일 에이전트 옵션과 기준선을 모두 능가한다.

ABSTRACT

Covering skill (a.k.a., option) discovery has been developed to improve the exploration of RL in single-agent scenarios with sparse reward signals, through connecting the most distant states in the embedding space provided by the Fiedler vector of the state transition graph. Given that joint state space grows exponentially with the number of agents in multi-agent systems, existing researches still relying on single-agent skill discovery either become prohibitive or fail to directly discover joint skills that improve the connectivity of the joint state space. In this paper, we propose multi-agent skill discovery which enables the ease of decomposition. Our key idea is to approximate the joint state space as a Kronecker graph, based on which we can directly estimate its Fiedler vector using the Laplacian spectrum of individual agents' transition graphs. Further, considering that directly computing the Laplacian spectrum is intractable for tasks with infinite-scale state spaces, we further propose a deep learning extension of our method by estimating eigenfunctions through NN-based representation learning techniques. The evaluation on multi-agent tasks built with simulators like Mujoco, shows that the proposed algorithm can successfully identify multi-agent skills, and significantly outperforms the state-of-the-art. Codes are available at: https://github.itap.purdue.edu/Clan-labs/Scalable_MAOD_via_KP.

연구 동기 및 목표

  • 다중 에이전트 강화 학습(MARL)에서 희박한 보상과 기하급수적 증가하는 상태 공간의 과제를 해결하기 위해.
  • 단일 에이전트 옵션에 의존하지 않고, 공동 상태 공간의 연결성을 향상시키는 직접적인 공동 다중 에이전트 옵션 탐색을 가능하게 하기 위해.
  • 딥 리prs제저장 학습을 활용해 무한 또는 대규모 상태 공간으로도 확장 가능한 방법을 개발하기 위해.
  • 다중 에이전트 옵션의 탈중앙화 및 중심화된 적용을 모두 지원하기 위해.

제안 방법

  • 개별 에이전트 전이 그래프의 크로네커 곱으로 공동 상태 공간을 근사한다.
  • 이론적 결과를 활용해 개별 에이전트 그래프의 라플라시안 스펙트럼을 이용해 공동 그래프의 페일러 벡터를 추정한다.
  • 추정된 페일러 벡터의 최소 및 최대 값에 해당하는 상태를 식별하여 알제브라적 연결성을 향상시키기 위해 커버링 옵션을 구성한다.
  • 지속적 또는 무한 규모 상태 공간을 위한 라플라시안 스펙트럼을 근사하기 위해 신경망을 사용하는 딥 러닝 확장 기법을 도입한다.
  • 탈중앙화, 중심화, 그룹 기반 등 다양한 적용 전략을 다중 에이전트 옵션에 적용할 수 있도록 지원한다.
  • 중앙집중형 Q-러닝 + 포스 알고리즘을 사용해 발견된 옵션을 계층적 MARL 프레임워크에 통합한다.

실험 결과

연구 질문

  • RQ1크로네커 그래프 근사가 MARL에서 공동 다중 에이전트 옵션의 효율적이고 확장 가능한 탐색을 가능하게 할 수 있는가?
  • RQ2개별 에이전트 전이 그래프 스펙트럼을 사용해 공동 상태 공간의 페일러 벡터를 얼마나 정확히 추정할 수 있는가?
  • RQ3희박한 보상이 주어지는 MARL 작업에서 단일 에이전트 옵션과 비교해 다중 에이전트 옵션이 공동 탐색과 성능을 크게 향상시킬 수 있는가?
  • RQ4딥 러닝 확장 기법이 연속적 또는 무한 상태 환경으로의 확장에 얼마나 효과적인가?
  • RQ5중앙화 대비 탈중앙화 적용의 성능 향상은 어떠한가?

주요 결과

  • 6에이전트 그리드 미로 작업에서, 쌍방향 다중 에이전트 옵션을 사용한 에이전트들은 단일 에이전트 옵션 또는 옵션 없이 실패한 작업을 성공적으로 완수했다.
  • 중앙집중적 훈련(중앙집중형 Q-러닝 + 포스)을 통해, 충돌률이 최대 63%까지 상승하는 상황에서도 다중 에이전트 옵션을 사용한 에이전트는 안정적인 성능을 기록하여 동적 간섭에 강건함을 입증했다.
  • 머지코 작업에서, 제안된 다중 에이전트 옵션을 사용한 에이전트들은 옵션 없이 훈련한 기준선 및 단일 에이전트 옵션을 사용한 에이전트보다 뛰어난 성능을 보였다. 특히 복잡한 협동 환경에서 두드러진 성능 향상이 관찰되었다.
  • 딥 러닝 확장 기법은 무한 규모 상태 공간을 가진 연속 제어 작업에서 효과적인 옵션 탐색과 적용을 가능하게 하였으며, 성능 향상도 유지하였다.
  • 다양한 환경인 그리드 미로, 그리드 룸, 머지코에서 제안된 방법은 상태 공간 기반 최첨단 기준선을 상회하는 뚜렷한 성능 향상을 달성하였으며, 일관된 우수성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.