Skip to main content
QUICK REVIEW

[논문 리뷰] Game Theoretic Control of Multi-Agent Systems

Ting Liu, Jinhuan Wang|arXiv (Cornell University)|2016. 07. 31.
Distributed Control Multi-Agent Systems참고 문헌 11인용 수 5
한 줄 요약

이 논문은 전역 목표 함수를 최대화하는 나시 균형에 수렴하도록 국소 유용도 함수를 설계하여 다중 에이전트 시스템의 분산 제어를 위한 게임 이론적 프레임워크를 제안한다. 고정 및 시간에 따라 변하는 연결 구조에 대해, 반탄적 행렬 곱셈 방법을 사용하여 이러한 유용도 함수의 존재에 대한 필요 및 충분 조건을 도출하여, 관성 동역학을 동반한 더 나은 반응 전략을 통해 시스템 전체 최적 상태로의 수렴을 보장한다.

ABSTRACT

Control of multi-agent systems via game theory is investigated. Assume a system level object is given, the utility functions for individual agents are designed to convert a multi-agent system into a potential game. First, for fixed topology, a necessary and sufficient condition is given to assure the existence of local information based utility functions. Then using local information the system can converge to a maximum point of the system object, which is a Nash equilibrium. It is also proved that a networked evolutionary potential game is a special case of this multi-agent system. Second, for time-varying topology, the state based potential game is utilized to design the optimal control. A strategy based Markov state transition process is proposed to assure the existence of state based potential function. As an extension of the fixed topology case, a necessary and sufficient condition for the existence of state depending utility functions using local information is also presented. It is also proved that using better reply with inertia strategy, the system converges to a maximum strategy of the state based system object, which is called the recurrent state equilibrium.

연구 동기 및 목표

  • 국소 유용도 함수를 설계하여 개별 에이전트의 인centive를 전역 시스템 목표와 일치시킴으로써 다중 에이전트 시스템의 분산 제어를 가능하게 한다.
  • 고정 연결 구조 다중 에이전트 시스템에서 국소 정보 기반 유용도 함수의 존재에 대한 필요 및 충분 조건을 수립한다.
  • 상태 기반 잠재 게임과 마르코프 전략 전이를 사용하여 프레임워크를 시간에 따라 변하는 연결 구조로 확장한다.
  • 관성 동역학을 동반한 더 나은 반응 전략 하에서 전역 목표 함수의 최대값으로의 수렴을 증명한다.
  • 네트워크 기반 진화 잠재 게임이 제안된 프레임워크의 특수한 경우임을 보여준다.

제안 방법

  • 유한 게임과 다중 에이전트 시스템의 전략 역학을 모델링하고 분석하기 위해 행렬의 반탄적 곱셈(STP)을 사용한다.
  • 게임이 주어진 전역 수준의 목표 함수를 갖는 잠재 게임으로 표현될 수 있는지를 특징짓기 위해 잠재 함수 방정식을 활용한다.
  • 행렬의 질량 조건을 사용하여 고정 연결 구조 시스템에서 국소 정보 기반 유용도 함수의 존재에 대한 필요 및 충분 조건을 유도한다.
  • 시간에 따라 변하는 연결 구조에서 상태 기반 잠재 함수의 존재와 잠재 함수의 비감소 성질을 보장하기 위해 전략 기반 마르코프 상태 전이 과정을 도입한다.
  • 관성 동역학을 동반한 더 나은 반응 전략을 적용하여 상태 기반 잠재 함수를 최대화하는 반복 상태 균형으로의 거의 확실한 수렴을 보장한다.
  • 유도된 조건를 만족시키기 위해 논리적 행렬과 벡터화 표현을 사용하여 명시적인 유용도 함수를 구성한다.
Figure 1 : Game Theoretic Approach
Figure 1 : Game Theoretic Approach

실험 결과

연구 질문

  • RQ1고정 연결 구조를 갖는 다중 에이전트 시스템에서 어떤 조건 하에 국소 유용도 함수를 설계할 수 있을까? 이때 시스템은 전역 목표를 최대화하는 나시 균형으로 수렴한다.
  • RQ2시간에 따라 변하는 연결 구조로 프레임워크를 어떻게 확장할 수 있을까? 이때 최적의 시스템 상태로의 수렴을 유지할 수 있는가?
  • RQ3동적 연결 구조에서 국소 정보만을 사용하여 상태에 의존하는 유용도 함수의 존재를 보장하는 조건는 무엇인가?
  • RQ4더 나은 반응 전략과 관성 동역학을 포함한 탈중앙화 학습 동역학 하에서 전역 최적값으로의 수렴을 보장할 수 있는가?
  • RQ5네트워크 기반 진화 잠재 게임이 이 일반화된 게임 이론적 제어 프레임워크에 얼마나 깊이 통합될 수 있는가?

주요 결과

  • 고정 연결 구조 다중 에이전트 시스템에서 국소 정보 기반 유용도 함수의 존재에 대한 필요 및 충분 조건이 시스템의 잠재 함수에 대한 행렬 질량 조건을 통해 유도되었다.
  • 프레임워크는 네트워크 기반 진화 잠재 게임이 전역 수준의 목표 함수를 갖는 제안된 다중 에이전트 시스템 모델의 특수한 경우임을 증명하였다.
  • 시간에 따라 변하는 연결 구조에 대해, 전략 기반 마르코프 과정이 제안되어 상태 기반 잠재 함수의 존재와 잠재 함수의 비감소 진화를 보장한다.
  • 관성 동역학을 동반한 더 나은 반응 전략을 사용하여 시스템은 거의 확실하게 상태 기반 잠재 함수를 최대화하는 반복 상태 균형으로 수렴한다.
  • 예시를 통해 시스템이 확률 1로 일치 상태에 도달함을 보여주었으며, 이는 모든 에이전트가 $a^* = (1,1,1,1)$라는 행동을 취할 때 전역 목표 함수가 최대화됨을 의미한다.
  • 고유한 반복 상태 균형 $[a^*, x^*]$에서 $a^* = (1,1,1,1)$ 이고 $x^* \in \{x_2, x_3\}$ 이며, 제안된 동역학 하에서 거의 확실한 극한으로 식별되었다.
Figure 2 : A Network
Figure 2 : A Network

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.