Skip to main content
QUICK REVIEW

[논문 리뷰] Non-cooperative Multi-agent Systems with Exploring Agents

Jalal Etesami, Christoph-Nikolas Straehle|arXiv (Cornell University)|2020. 05. 25.
Reinforcement Learning in Robotics참고 문헌 59인용 수 4
한 줄 요약

이 논문은 마르코프 게임에서 에이전트들이 협력적 의사소통 없이 근사 최적 행동을 탐색할 수 있도록 보틀만-지브스 분포 전략을 사용하는 비협력적 다중에이전트 강화학습 프레임워크를 제안한다. 미약한 조건 하에 결합 벨먼 방정식의 유일한 해를 확립하고, 유한 및 무한 수명 주기 설정에서 수렴 가능성이 보장되는 알고리즘을 제안하며, 최대 인과 엔트로피 원리와 연결하여 공동 목표 및 정책 추론을 가능하게 한다.

ABSTRACT

Multi-agent learning is a challenging problem in machine learning that has applications in different domains such as distributed control, robotics, and economics. We develop a prescriptive model of multi-agent behavior using Markov games. Since in many multi-agent systems, agents do not necessary select their optimum strategies against other agents (e.g., multi-pedestrian interaction), we focus on models in which the agents play "exploration but near optimum strategies". We model such policies using the Boltzmann-Gibbs distribution. This leads to a set of coupled Bellman equations that describes the behavior of the agents. We introduce a set of conditions under which the set of equations admit a unique solution and propose two algorithms that provably provide the solution in finite and infinite time horizon scenarios. We also study a practical setting in which the interactions can be described using the occupancy measures and propose a simplified Markov game with less complexity. Furthermore, we establish the connection between the Markov games with exploration strategies and the principle of maximum causal entropy for multi-agent systems. Finally, we evaluate the performance of our algorithms via several well-known games from the literature and some games that are designed based on real world applications.

연구 동기 및 목표

  • 에이전트 간 완전한 협력이나 통신 없이 근사 최적 전략을 탐색하는 다중에이전트 시스템을 모델링하기 위해.
  • 상호 인식과 확률적 전략 선택을 반영하는 마르코프 게임 기반의 게임 이론적 프레임워크를 개발하기 위해.
  • 결합된 벨먼 방정식이 고유한 해를 가지는 조건을 확립하여 모델 안정성을 보장하기 위해.
  • 유한 및 무한 시간 수명 주기 시나리오 모두에 대해 수렴 가능성이 보장되는 알고리즘을 설계하기 위해.
  • 관측된 행동에서 에이전트의 목표와 전략을 공동으로 추론할 수 있도록, 모델을 최대 인과 엔트로피 원리와 연결하기 위해.

제안 방법

  • 행동 확률이 Q-값과 온도 매개변수에 의존하는 보틀만-지브스 분포를 사용하여 에이전트 전략을 모델링한다.
  • 에이전트 간 상호 의존성을 반영하는 Q-값과 정책을 동시에 결정하는 결합된 벨먼 방정식의 시스템을 유도한다.
  • 공동 정책 업데이트에 대한 압축 사상 성질 등을 포함한 충분한 조건을 도입하여 결합 방정식의 유일한 해를 보장한다.
  • 유한 수명 주기와 무한 수명 주기 설정 모두에 적합한 두 가지 알고리즘을 제안하며, 둘 다 고유한 해로 수렴함을 증명한다.
  • 실제 설정에서 계산 복잡도를 줄이기 위해 점유도 측정을 활용한 단순화된 전진-후진 알고리즘을 도입한다.
  • 제안된 모델과 최대 인과 엔트로피 원리 사이의 공식적 연결을 확립하여 목표와 정책의 공동 추론을 가능하게 한다.

실험 결과

연구 질문

  • RQ1다중에이전트 탐색을 위한 결합된 벨먼 방정식 시스템이 고유한 해를 가지는 조건는 무엇인가?
  • RQ2협력적이지 않고 통신이 없는 환경에서 에이전트는 상호 인식과 일관성을 유지하면서 근사 최적일 뿐만 아니라 안정적인 탐색 전략을 어떻게 선택할 수 있는가?
  • RQ3제안된 알고리즘이 유한 및 무한 시간 수명 주기 시나리오 모두에서 해로 수렴함을 보장할 수 있는가?
  • RQ4점유도 측정은 마르코프 게임를 해결하는 데 있어 계산 복잡도를 어떻게 줄일 수 있는가?
  • RQ5제안된 모델과 다중에이전트 시스템에서 최대 인과 엔트로피 원리 사이의 이론적 연결은 무엇인가?

주요 결과

  • 압축 사상 성질이 포함된 미약한 조건 하에, 결합된 벨먼 방정식 시스템은 고유한 해를 갖는다.
  • 제안된 유한 수명 주기 알고리즘은 유한 시간 내에 고유한 해로 수렴하며, 압축 사상 원리에 의해 수렴이 보장된다.
  • 무한 수명 주기 알고리즘 역시 고유한 해로 수렴하며, 적절한 가정 하에 고정점 반복을 통해 수렴이 증명된다.
  • 점유도 측정을 기반으로 한 전진-후진 알고리즘은 일반적인 마르코프 게임 공식화에 비해 복잡도를 감소시켜 확장 가능한 추론을 가능하게 한다.
  • 모델은 최대 인과 엔트로피 원리와 공식적으로 연결되어 있으며, 관측된 행동에서 에이전트의 목표와 전략을 공동으로 추론할 수 있다.
  • 기본 테스트 및 실제 세계를 모델링한 게임에서의 실험 평가를 통해, 경쟁적 환경에서 안정적이고 근사 최적적이며 충돌을 방지하는 행동을 생성할 수 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.