Skip to main content
QUICK REVIEW

[논문 리뷰] Influence-Based Multi-Agent Exploration

Tonghan Wang, Jianhao Wang|arXiv (Cornell University)|2019. 10. 12.
Reinforcement Learning in Robotics참고 문헌 58인용 수 5
한 줄 요약

이 논문은 상호정보량과 새로운 상호작용의 가치(Value of Interaction, VoI) 측정법을 사용하여 분산된 탐색을 조율하는 영향 기반의 다중 에이전트 탐색 방법 두 가지—정보이론적 영향을 통한 탐색(EITI)과 의사결정이론적 영향을 통한 탐색(EDTI)—을 제안한다. 이들 방법은 정책 기울기 프레임워크에 내재 보상 정규화 요소로 통합되어, 희소 보상 다중 에이전트 환경에서 협력적이고 고보상 정책으로 이어지는 상호작용 지점을 탐색하고 이용하도록 에이전트를 학습시킨다.

ABSTRACT

Intrinsically motivated reinforcement learning aims to address the exploration challenge for sparse-reward tasks. However, the study of exploration methods in transition-dependent multi-agent settings is largely absent from the literature. We aim to take a step towards solving this problem. We present two exploration methods: exploration via information-theoretic influence (EITI) and exploration via decision-theoretic influence (EDTI), by exploiting the role of interaction in coordinated behaviors of agents. EITI uses mutual information to capture influence transition dynamics. EDTI uses a novel intrinsic reward, called Value of Interaction (VoI), to characterize and quantify the influence of one agent's behavior on expected returns of other agents. By optimizing EITI or EDTI objective as a regularizer, agents are encouraged to coordinate their exploration and learn policies to optimize team performance. We show how to optimize these regularizers so that they can be easily integrated with policy gradient reinforcement learning. The resulting update rule draws a connection between coordinated exploration and intrinsic reward distribution. Finally, we empirically demonstrate the significant strength of our method in a variety of multi-agent scenarios.

연구 동기 및 목표

  • 희소 보상 환경에서 전이 의존적인 다중 에이전트 강화학습 설정에 적합한 탐색 방법의 부족을 보완한다.
  • 상태-행동 공간 내 핵심 상호작용 지점을 식별하고 방문함으로써 에이전트가 탐색을 공유할 수 있도록 한다.
  • 한 에이전트의 행동이 다른 에이전트의 학습과 성능에 미치는 영향을 반영하는 내재 보상 메커니즘을 개발한다.
  • 영향 기반 탐색을 정책 기울기 프레임워크에 통합하여 분산형이고 확장 가능한 훈련을 가능하게 한다.
  • 장기적 협력을 요구하는 복잡한 협력적 다중 에이전트 작업 전반에서의 효과성을 입증한다.

제안 방법

  • 에이전트 간 전이 동역학의 상호의존성을 정량화하기 위해 상호정보량(MI)을 사용하는 EITI를 제안한다.
  • 한 에이전트의 행동이 다른 에이전트의 기대 수익에 미치는 인과적 영향을 측정하기 위해 새로운 상호작용의 가치(VoI) 측정법을 도입하는 EDTI를 제안한다.
  • 정책 기울기 목표에 MI와 VoI를 정규화 요소로 통합하여 높은 영향력을 지닌 상태 탐색을 장려한다.
  • 경로 데이터만으로도 기울기 추정이 가능한 보정된 정책 기울기 갱신을 유도한다. 이를 통해 엔드 투 엔드 훈련이 가능해진다.
  • 중앙 집중적 조율 없이도 영향 측정 기반 내재 보상 계산을 분산 처리함으로써 분산 학습을 가능하게 한다.
  • 팀원 간 내재 보상의 분포와 협력적 탐색을 연결하여 학습 효율성 향상을 설명한다.

실험 결과

연구 질문

  • RQ1희소 보상 환경에서 효과적인 다중 에이전트 탐색을 지원할 수 있도록 에이전트 간 영향을 어떻게 정량화할 수 있는가?
  • RQ2상호정보량이 다중 에이전트 시스템에서 협력적 탐색을 이끄는 의미 있는 상호작용 역학을 포괄할 수 있는가?
  • RQ3정보이론적 측정법보다 의사결정이론적 측정법인 상호작용의 가치(VoI)가 더 높은 영향력을 지닌 상호작용을 잘 식별할 수 있는가?
  • RQ4다중 에이전트 환경에서 영향 기반 내재 보상은 전통적인 궁금증 또는 내재 형태 조정 방법과 비교해 어떻게 다를까?
  • RQ5영향 기반 탐색은 복잡한 작업에서 하위목표를 어떻게 발견하고 장기적 협력을 가능하게 하는가?

주요 결과

  • EITI와 EDTI는 희소 보상 협력적 다중 에이전트 작업인 Push-box, Island, Large-island에서 기존 방법들을 뛰어넘는 성능을 보였다.
  • Push-box 작업에서는 두 방법 모두 다단계 밀기 정책을 성공적으로 학습했고, 모든 기준 방법들은 어떤 보상도 달성하지 못했다.
  • Island 작업에서는 보물 수거로 인한 局소 최적점이 존재함에도 불구하고, EDTI가 에이전트가 집단적 사냥 전략을 발견하고 활용하도록 했다.
  • 모든 상호작용이 성능 향상으로 이어지지 않는 작업에서는 EDTI가 EITI를 능가했으며, 이는 비유익 상호작용을 걸러내는 능력 덕분이었다.
  • 메서드들은 암묵적으로 하위목표로 작용하는 영향력 있는 상태를 발견하여, 고가치 협력 패턴으로 향하는 탐색을 이끌었다.
  • 실험 결과, 영향 측정법(MI 및 VoI)이 효과적인 탐색과 관련이 있으며, 복잡한 환경에서 수렴 속도를 빠르게 한다는 것이 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.