Skip to main content
QUICK REVIEW

[논문 리뷰] Maximum-Entropy Multi-Agent Dynamic Games: Forward and Inverse Solutions

Negar Mehr, Mingyu Wang|arXiv (Cornell University)|2021. 10. 03.
Traffic control and management인용 수 6
한 줄 요약

이 논문은 연속 상태와 행동을 갖는 제한된 이성성을 갖는 다중 에이전트 동적 게임에서의 새로운 스토케스틱 내쉬 균형인 엔트로피 비용 균형(ECE)을 소개한다. 선형-정규분포-가우시안(LQG) 설정에서는 정확한 ECE 피드백 정책을 계산하기 위한 리카티 기반 알고리즘을 제안하고, 비선형 케이스에는 반복적 방법을 제안하여 게임 이론적 상호작용과 제한된 이성성을 고려함으로써 시연 데이터로부터 에이전트의 비용 함수를 정확하게 역학습할 수 있도록 한다.

ABSTRACT

In this paper, we study the problem of multiple stochastic agents interacting in a dynamic game scenario with continuous state and action spaces. We define a new notion of stochastic Nash equilibrium for boundedly rational agents, which we call the Entropic Cost Equilibrium (ECE). We show that ECE is a natural extension to multiple agents of Maximum Entropy optimality for single agents. We solve both the "forward" and "inverse" problems for the multi-agent ECE game. For the forward problem, we provide a Riccati algorithm to compute closed-form ECE feedback policies for the agents, which are exact in the Linear-Quadratic-Gaussian case. We give an iterative variant to find locally ECE feedback policies for the nonlinear case. For the inverse problem, we present an algorithm to infer the cost functions of the multiple interacting agents given noisy, boundedly rational input and state trajectory examples from agents acting in an ECE. The effectiveness of our algorithms is demonstrated in a simulated multi-agent collision avoidance scenario, and with data from the INTERACTION traffic dataset. In both cases, we show that, by taking into account the agents' game theoretic interactions using our algorithm, a more accurate model of agents' costs can be learned, compared with standard inverse optimal control methods.

연구 동기 및 목표

  • 에이전트가 제한된 이성을 보이고 소음이 있는 의사결정을 하는 다중 에이전트 상호작용 시스템에서 비용 함수를 학습하는 데 도전하는 것.
  • 최대 엔트로피 최적성의 다중 에이전트 설정으로의 확장을 가능하게 하는 새로운 균형 개념인 엔트로피 비용 균형(ECE)을 체계화하는 것.
  • 선형-정규분포-가우시안(LQG) 게임에서 ECE 피드백 정책을 닫힌 형태로 계산하고 비선형 역학에서는 반복적으로 계산하여 정방향 문제를 해결하는 것.
  • 게임 이론적 일致성을 유지하면서 시연 데이터로부터 소음이 있는 제한된 이성성의 궤적을 기반으로 에이전트의 비용 함수를 추론하여 역방향 문제를 해결하는 것.
  • 표준 IRL/IOC에 비해 에이전트 간 피드백 상호작용을 명시적으로 모델링함으로써 역모델링 정확도를 향상시키는 것.

제안 방법

  • 제한된 이성성을 최대 엔트로피 정책 분포를 통해 통합한 스토케스틱 내쉬 균형으로서 엔트로피 비용 균형(ECE)을 정의한다.
  • 선형-정규분포-가우시안(LQG) 게임에서 정확한 ECE 피드백 정책을 계산하기 위한 리카티 유형의 재귀식을 유도한다. 이는 LQR 및 LQGame 해법과 유사하다.
  • 일반적인 역학과 비용 함수를 갖는 비선형 다중 에이전트 시스템에서 ECE 정책을 근사하기 위한 반복적 알고리즘을 제안한다.
  • 역문제를 특성 기대값 매칭 작업으로 설정하여, ECE 정책이 시연 데이터로부터의 경험적 특성 평균과 일치하도록 비용 함수 가중치를 학습한다.
  • 동적 프rogram밍과 이차 비용-도달 함수의 구조를 사용하여 최적의 비용-도달 함수가 여전히 이차 함수로 유지됨을 증명함으로써 정책 매개변수의 재귀적 계산을 가능하게 한다.
  • 정방향 ECE 해법을 역알고리즘에 통합하여, 기울기 기반 최적화를 통해 정책 계산과 비용 함수 갱신을 번갈아 수행한다.

실험 결과

연구 질문

  • RQ1다중 에이전트 동적 게임에서 인간의 의사결정의 제한된 이성성과 소음은 어떻게 모델링할 수 있는가?
  • RQ2최대 엔트로피 최적성의 다중 에이전트 설정으로의 일반화를 위한 원칙적인 게임 이론적 균형 개념은 무엇인가?
  • RQ3선형-정규분포-가우시안 다중 에이전트 시스템에서 닫힌 형태의 ECE 피드백 정책를 유도할 수 있는가?
  • RQ4게임 이론적 일치성을 유지하면서 시연 데이터로부터 에이전트의 비용 함수를 추론하는 역문제는 어떻게 해결할 수 있는가?
  • RQ5역학습에서 에이전트 간 상호작용을 고려하면 표준 IRL/IOC 방법에 비해 더 정확한 비용 함수 복원이 가능한가?

주요 결과

  • 엔트로피 비용 균형(ECE)은 단일 에이전트 설정에서 최대 엔트로피 원리와 수학적으로 동일하며, 이를 다중 에이전트 동적 게임으로 일반화한다.
  • LQG 게임에서는 리카티 재귀식을 사용하여 ECE 피드백 정책을 닫힌 형태로 계산하며, 정책 평균과 공분산에 대한 정확한 해를 제공한다.
  • 비선형 설정에서는 반복 알고리즘이 이차 근사의 일련의 문제를 해결함으로써 국소적으로 최적의 ECE 정책으로 수렴한다.
  • 역알고리즘은 합성 및 실세계 교통 데이터(INTERACTION 데이터셋)로부터 비용 함수를 성공적으로 복원하였으며, 표준 IRL에 비해 모델링 정확도가 뛰어나다.
  • 다중 에이전트 충돌 회피 시나리오에 적용했을 때, 기준 IRL 방법보다 관찰된 인간 유사 행동과 더 잘 일치하는 비용 함수를 학습한다.
  • ECE 프레임워크를 통해 정책 엔트로피와 제한된 이성성을 명시적으로 모델링함으로써, 소음이 있는 시연 데이터에 대해 뛰어난 강건성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.