Skip to main content
QUICK REVIEW

[논문 리뷰] Inverse Dynamic Games Based on Maximum Entropy Inverse Reinforcement Learning

Jairo Inga, Esther Bischoff|arXiv (Cornell University)|2019. 11. 18.
Advanced Control Systems Optimization참고 문헌 38인용 수 8
한 줄 요약

이 논문은 연속 상태 및 제어 공간을 가진 N명의 플레이어로 구성된 동적 게임에 최대 엔트로피 역강화 학습을 확장하여, 파레토 효율적 해와 개방형, 피드백 나시 균형을 위한 비용 함수 파라미터 식별 방법을 제안한다. 주요 기여는 각각의 역동적 게임 설정에서 비용 함수 파라미터의 편향 없는 추정을 보장하는 이론적 증명과 노이즈 조건 하에서 비선형 및 선형-제곱형 시뮬레이션에서의 뛰어난 안정성이다.

ABSTRACT

We consider the inverse problem of dynamic games, where cost function parameters are sought which explain observed behavior of interacting players. Maximum entropy inverse reinforcement learning is extended to the N-player case in order to solve inverse dynamic games with continuous-valued state and control spaces. We present methods for identification of cost function parameters from observed data which correspond to (i) a Pareto efficient solution, (ii) an open-loop Nash equilibrium or (iii) a feedback Nash equilibrium. Furthermore, we give results on the unbiasedness of the estimation of cost function parameters for each arising class of inverse dynamic game. The applicability of the methods is demonstrated with simulation examples of a nonlinear and a linear-quadratic dynamic game.

연구 동기 및 목표

  • 관측된 플레이어 행동으로부터 비용 함수 파라미터를 추론하여 역동적 게임의 역문제를 해결한다.
  • 다중 에이전트 환경에서 연속 상태 및 제어 공간에 대한 최대 엔트로피 역강화 학습을 확장한다.
  • 파레토 효율성, 개방형 나시, 피드백 나시 균형이라는 세 가지 해 개념에 대해 식별 가능한 방법을 개발한다.
  • 각 역동적 게임 설정에서 비용 함수 파라미터의 편향 없는 추정을 보장하는 이론적 조건을 수립한다.
  • 노이즈가 있는 측정 조건 하에서 비선형 및 선형-제곱형 동적 게임의 시뮬레이션을 통해 접근법을 검증한다.

제안 방법

  • 연속 상태 및 제어 공간을 가진 N명의 플레이어로 구성된 동적 게임에 최대 엔트로피 원리를 적용하여 확률적 궤적 분포를 유도한다.
  • 선형-파rameter 구조를 가진 기능 기반 비용 함수를 사용하여 개별 플레이어의 목표를 모델링한다.
  • 균형 조건에서 유도된 제약 조건 하에 관측된 궤적의 엔트로피를 최대화하는 방식으로 최대우도 추정을 통해 역문제를 해결한다.
  • 선형-제곱형 게임에서 피드백 나시 균형 궤적을 계산하기 위해 결합된 리카티 방정식을 사용한다.
  • 비볼록 최적화 문제를 해결하기 위해 BFGS 최적화 방법을 활용하여 파라미터 식별을 수행한다.
  • 각 해 개념(파레토, 개방형, 피드백 나시)에 대해 비용 함수 파라미터의 편향 없는 추정을 위한 이론적 조건을 유도한다.

실험 결과

연구 질문

  • RQ1최대 엔트로피 역강화 학습은 연속 상태 및 제어 공간을 가진 N명의 플레이어로 구성된 동적 게임에 효과적으로 확장될 수 있는가?
  • RQ2협동적 동적 게임에서 역강화 학습을 통해 파레토 효율적 해를 위한 비용 함수 파라미터를 어떻게 식별할 수 있는가?
  • RQ3개방형 및 피드백 나시 균형 가정 하에서 비협력적 동적 게임의 파라미터 식별에 대해 제안된 방법의 성능과 내구성은 어떠한가?
  • RQ4각 해 개념에 대해 추정된 비용 함수 파라미터가 편향 없이 추정되기 위한 조건은 무엇인가?
  • RQ5측정 노이즈는 역동적 게임에서의 파라미터 식별 정확도에 어떤 영향을 미치는가?

주요 결과

  • 이 방법은 파레토 효율성, 개방형 나시, 피드백 나시 균형이라는 세 가지 해 개념에 대해 관측된 궤적을 재현하는 데 성공적으로 비용 함수 파라미터를 식별한다.
  • 비선형 펜듈럼 예제에서는 이상 조건 하에서 상태에 대해 NMAE 0.010, 제어에 대해 NMAE 0.016으로 진정한 값에 매우 가까운 추정을 달성한다.
  • 선형-제곱형 예제에서는 무한대 SNR 조건에서 상태에 대해 NMAE 0.013, 제어에 대해 NMAE 0.032를 유지하며, SNR가 20 dB 이하로 떨어지면 성능이 저하된다.
  • 피드백 나시 역게임 방법은 노이즈에 더 민감하며, 15 dB SNR에서 제어의 NMAE가 0.998로 상승하지만, 더 높은 SNR에서 성능이 크게 향상된다.
  • 이론적 분석을 통해 제안된 프레임워크 하에서 세 가지 해 개념 모두에 대해 비용 함수 파라미터 추정이 편향 없음을 확인한다.
  • 협동 게임(CG)에서는 노이즈에 강건하여 15 dB SNR에서도 NMAE가 0.015 이하를 유지하지만, 비협력적 방법은 더 낮은 SNR에서 성능 저하가 더 빠르게 나타난다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.