Skip to main content
QUICK REVIEW

[논문 리뷰] Coordinated Exploration via Intrinsic Rewards for Multi-Agent Reinforcement Learning

Shariq Iqbal, Fei Sha|arXiv (Cornell University)|2019. 05. 28.
Reinforcement Learning in Robotics참고 문헌 34인용 수 34
한 줄 요약

본 논문은 다중 에이전트 간 탐사를 조정하는 내재 보상을 소개하고, 공유 재생 버퍼로 여러 탐사 정책을 병렬 학습하며, 희소한 협력 환경에서 외재 보상을 최대화하기 위해 이들 중에서 동적으로 선택하는 메타 정책을 사용한다.

ABSTRACT

Solving tasks with sparse rewards is one of the most important challenges in reinforcement learning. In the single-agent setting, this challenge is addressed by introducing intrinsic rewards that motivate agents to explore unseen regions of their state spaces; however, applying these techniques naively to the multi-agent setting results in agents exploring independently, without any coordination among themselves. Exploration in cooperative multi-agent settings can be accelerated and improved if agents coordinate their exploration. In this paper we introduce a framework for designing intrinsic rewards which consider what other agents have explored such that the agents can coordinate. Then, we develop an approach for learning how to dynamically select between several exploration modalities to maximize extrinsic rewards. Concretely, we formulate the approach as a hierarchical policy where a high-level controller selects among sets of policies trained on diverse intrinsic rewards and the low-level controllers learn the action policies of all agents under these specific rewards. We demonstrate the effectiveness of the proposed approach in cooperative domains with sparse rewards where state-of-the-art methods fail and challenging multi-stage tasks that necessitate changing modes of coordination.

연구 동기 및 목표

  • 희소-보상 협력 MARL 문제를 해결하기 위해 에이전트 간의 조정을 통한 탐사를 가능하게 한다.
  • 다른 에이전트가 탐색한 영역을 고려한 내재 보상 함수를 제안한다.
  • 샘플 효율성을 위해 공유 재생 버퍼를 사용하여 여러 탐사 정책을 병렬로 학습한다.
  • 외재 보상을 극대화하기 위해 서로 다른 내재 보상 유형으로 학습된 탐사 모드를 동적으로 선택하는 메타 정책을 개발한다.

제안 방법

  • 다른 모든 에이전트에서 관측의 참신성 여부에 의존하는 다중 에이전트 내재 보상을 정의한다.
  • 조정 친화적 내재 보상(좌표별 단조성 및 내부 지향성)에 대한 요구사항을 기술한다.
  • 공유 재생 버퍼와 오프폴리시 SAC 변형을 사용하여 서로 다른 내재 보상 유형으로 각기 다른 정책을 병렬로 학습한다.
  • 더 높은 수준의 메타 정책이 서로 다른 내재 보상으로 학습된 정책들 중에서 선택하여 외재 수익을 극대화하는 계층적 설정을 사용한다.
  • 외재 보상과 내재 보상 모두에 대해 정책 그래디언트와 Q 함수 타깃을 제시하고, 보상 유형 간 기저를 공유하는 크로스 헤드 아키텍처를 도입한다.
  • 메타 정책을 훈련시켜 보상 유형 간 탐사를 유지하기 위해 엔트로피를 활용한다.

실험 결과

연구 질문

  • RQ1다중 에이전트 내재 보상을 통해 탐사를 조정하는 것이 희소 보상 협력 작업의 성능을 향상시키는가?
  • RQ2메타 정책이 다양한 탐사 양식을 효과적으로 전환하여 외재 보상을 극대화할 수 있는가?
  • RQ3적응적이고 조정된 탐사 전략이 다중 에이전트 환경에서 고정되거나 단순한 적응보다 성능이 우수한가?
  • RQ4공유 재생 버퍼를 통해 데이터를 공유하는 것이 여러 내재 보상 유형 간 샘플 효율성에 어떤 영향을 미치는가?

주요 결과

  • 에이전트 간 조정을 통해 좌표화된 다중 에이전트 내재 보상이 여러 과제에서 독립적 내재 탐색보다 우수하다.
  • 적응적 접근은 동일한 샘플 예산을 사용할 때 비적응성 올바른 예측(최상의 고정 보상 유형)을 상회하거나 같게 만든다.
  • 협력 전략을 바꿔야 하는 과제에서 적응적 방법이 모든 고정 보상 함수보다 우수하다.
  • 메타 정책이 탐사와 활용 사이의 균형을 유지하고 단일 탐사 유형으로의 수렴을 방지한다.
  • 다양한 조정 필요성(예: 과제 3 및 Flip-Task)에서 적응적 전략의 이점이 나타난다.
  • 그리드월드와 VizDoom 도메인 모두에서 방법이 여전히 효과적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.