Skip to main content
QUICK REVIEW

[논문 리뷰] Feudal Multi-Agent Hierarchies for Cooperative Reinforcement Learning

Sanjeevan Ahilan, Peter Dayan|arXiv (Cornell University)|2019. 01. 24.
Reinforcement Learning in Robotics참고 문헌 37인용 수 21
한 줄 요약

이 논문은 다수의 워커 에이전트가 협동 학습을 가능하게 하기 위해 매니저 에이전트가 하위 목표를 통신하는 분산형 강화학습 프레임워크인 Feudal Multi-Agent Hierarchies (FMH)를 제안한다. 전역 보상은 매니저에만 할당하고 워커에는 하위 목표 기반 보상을 사용함으로써, 특히 고차원의 다에이전트 환경에서 중심화 또는 순수히 분산된 방법에 비해 협동성, 확장성, 학습 안정성이 향상된다.

ABSTRACT

We investigate how reinforcement learning agents can learn to cooperate. Drawing inspiration from human societies, in which successful coordination of many individuals is often facilitated by hierarchical organisation, we introduce Feudal Multi-agent Hierarchies (FMH). In this framework, a 'manager' agent, which is tasked with maximising the environmentally-determined reward function, learns to communicate subgoals to multiple, simultaneously-operating, 'worker' agents. Workers, which are rewarded for achieving managerial subgoals, take concurrent actions in the world. We outline the structure of FMH and demonstrate its potential for decentralised learning and control. We find that, given an adequate set of subgoals from which to choose, FMH performs, and particularly scales, substantially better than cooperative approaches that use a shared reward function.

연구 동기 및 목표

  • 협동 다에이전트 강화학습에서 비정적성, 보상 할당, 확장성 문제를 해결하기 위해.
  • 인간 사회에서 영감을 얻은 계층적 구조가 다에이전트 시스템의 협동성과 학습 효율성을 향상시킬 수 있는지 탐색하기 위해.
  • 전체 상태 공유에 의존하지 않고도 효과적인 협동을 달성하기 위해 매니저의 하위 목표 통신를 통한 분산 학습을 가능하게 하기 위해.
  • 보상 기반 계층적 구조가 복잡한 다에이전트 작업에서 공유 보상 및 중심화된 학습 접근 방식을 능가할 수 있는지 증명하기 위해.

제안 방법

  • 단일 매니저 에이전트가 전역 작업 보상을 최대화하는 데 책임지는 계층적 구조를 정의한다.
  • 매니저가 다수의 워커 에이전트에게 하위 목표를 통신하며, 워커는 전역 보상 대신 이러한 하위 목표를 달성하는 데 성공한 경우에 보상을 받는다.
  • 워커는 독립적으로 행동하며, 관측치에 통신된 하위 목표가 포함된 동시 동작을 수행한다.
  • 하위 목표에서 보상으로의 매핑은 사전에 지정되어 있으며, 매니저의 통신을 워커 전용 보상 함수로 변환한다.
  • 딥 강화학습(DDPG)을 사용하여 학습하며, 목표 설정 행동의 학습 안정성을 높이기 위해 사전 학습과 반복적 통신을 수행한다.
  • 분산 학습을 지원하면서도 계층적 보상 구조를 통해 협동성을 유지한다.

실험 결과

연구 질문

  • RQ1계층적 매니저-워커 구조가 협동 다에이전트 강화학습에서 협동성과 확장성 향상에 기여할 수 있는가?
  • RQ2하위 목표 기반 보상 분해 방식이 공유 전역 보상에 비해 학습 안정성과 성능에 어떤 영향을 미치는가?
  • RQ3하나의 매니저 아래에서 동시에 작동하는 다수의 워커를 도입함으로써 분산 학습이 중심화된 학습에 비해 어느 정도 우월한가?
  • RQ4단일 매니저 아래에서 다수의 동시 워커를 도입할 경우 학습 효율성과 수렴성에 어떤 영향을 미치는가?

주요 결과

  • FMH는 작업 성능과 확장성 측면에서 분산형 및 중심화된 협동 다에이전트 강화학습 방법을 모두 뛰어넘는다.
  • 하위 목표 기반 보상 덕분에 워커 정책이 더 예측 가능해져 학습 중 비정적성이 감소한다.
  • 전체 관측치 공유 없이도 다수의 워커 간 효과적인 협동을 달성하여 분산 환경에서도 뛰어난 내성적 안정성을 보인다.
  • 시스템 복잡성이 증가함에 따라 많은 에이전트와 가능한 하위 목표로도 효과적으로 확장되며 높은 성능 유지를 유지한다.
  • 사전 학습과 반복적 통신는 매니저의 목표 설정 행동 학습을 향상시켜 전체 시스템의 안정성을 강화한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.