[논문 리뷰] Competitive Multi-agent Inverse Reinforcement Learning with Sub-optimal Demonstrations
이 논문은 심층 신경망을 사용한 적대적 훈련을 통해 전문가 정책과 내쉬 균형 전략 간의 성능 격차를 직접 최소화함으로써, 부분적으로 최적화되지 않은 전문가 시연를 고려하는 경쟁적 다중에이전트 역강화학습 프레임워크를 제안한다. 10×10 격자도시 추격 게임과 같은 대규모 제로섬 스토케스틱 게임에서, 에이전트를 분리하지 않고 보상 함수와 내쉬 균형 정책을 동시에 학습함으로써 뛰어난 성능을 달성한다.
This paper considers the problem of inverse reinforcement learning in zero-sum stochastic games when expert demonstrations are known to be not optimal. Compared to previous works that decouple agents in the game by assuming optimality in expert strategies, we introduce a new objective function that directly pits experts against Nash Equilibrium strategies, and we design an algorithm to solve for the reward function in the context of inverse reinforcement learning with deep neural networks as model approximations. In our setting the model and algorithm do not decouple by agent. In order to find Nash Equilibrium in large-scale games, we also propose an adversarial training algorithm for zero-sum stochastic games, and show the theoretical appeal of non-existence of local optima in its objective function. In our numerical experiments, we demonstrate that our Nash Equilibrium and inverse reinforcement learning algorithms address games that are not amenable to previous approaches using tabular representations. Moreover, with sub-optimal expert demonstrations our algorithms recover both reward functions and strategies with good quality.
연구 동기 및 목표
- 복잡한 게임에서 흔히 실현 불가능한 최적의 전문가 시범을 가정하는 기존 다중에이전트 IRL 방법의 한계를 해결하기 위해.
- 에이전트를 분리하지 않고도 보상 함수와 내쉬 균형 정책을 함께 학습할 수 있는 통합 프레임워크를 개발하기 위해.
- 제로섬 스토케스틱 게임에서 전문가 시범과 최적(내쉬 균형) 전략 간의 성능 격차를 최소화하기 위해.
- 전역 수렴 보장을 갖춘 내쉬 균형 계산을 위한 적대적 훈련 알고리즘을 설계하기 위해.
- 표본표 방법이 실패하는 대규모 게임에서 이론적 효과를 입증하기 위해.
제안 방법
- 알고리즘은 내쉬 균형을 적대적 훈련을 통해 계산하는 정책 단계와 전문가 정책과 내쉬 전략 간의 성능 격차를 줄이기 위해 보상 함수를 업데이트하는 보상 단계를 번갈아 수행한다.
- 적대적 훈련은 에이전트가 최적의 상대방과 대결하도록 하며, 정책 개선에는 Proximal Policy Optimization (PPO)를 사용하고, 심층 신경망을 정책과 가치 함수를 모델링하는 데 활용한다.
- 보상 함수는 심층 신경망으로 모델링되며, 현재 내쉬 정책에서 유도된 최적 행동과 전문가 행동 간의 성능 격차를 최소화하기 위해 확률적 경사 하강법으로 훈련된다.
- 부분 최적 행동을 허용할 수 있는 제약 조건에 고정된 라그랑주 승수 λ를 추가하며, λ는 그리드 서치를 통해 튜닝되었고 최적 값 λ=10 으로 도출되었다.
- 에이전트 간의 게임이론적 상호의존성을 유지하기 위해, 보상과 정책을 함께 최적화하는 공동 최적화 루프를 통해 에이전트를 분리하지 않는다.
- 이론적 분석을 통해 적대적 훈련 목표 함수가 국소 최적점이 없음을 입증하였으며, 이는 최적 해로의 전역 수렴을 지원한다.
실험 결과
연구 질문
- RQ1전문가 시범이 부분 최적일 경우 경쟁적 다중에이전트 시스템에서 보상 함수와 내쉬 균형 정책을 효과적으로 복원할 수 있는가?
- RQ2에이전트를 분리하지 않는 다중에이전트 IRL에서 공동 학습 프레임워크를 어떻게 설계할 수 있으며, 전략적 상호의존성을 유지할 수 있는가?
- RQ3전문가와 내쉬 균형 전략 간의 성능 격차를 명시적으로 최소화하는 것이 학습 품질에 어떤 영향을 미치는가?
- RQ4딥 강화학습을 활용한 적대적 훈련이 제로섬 스토케스틱 게임에서 전역 수렴을 달성할 수 있는가?
- RQ5제안된 방법은 표본표 방법이 다루기 어려운 대규모 게임에 얼마나 잘 스케일링되는가?
주요 결과
- 10×10 격자도시 추격 게임에서, 제안된 알고리즘이 분리 최적화를 사용한 벤치마크 알고리즘 대비 약도 정책 성능을 48.6% 향상시켰다.
- 사냥개에 대해 제안된 방법은 10×10 격자에서 벤치마크 알고리즘 대비 성능을 5.9% 향상시켰다.
- 5×5 격자에서 제안된 알고리즘은 더 나은 약도 정책(-44.7 대비 -87.4)을 생성하였고, 벤치마크와 유사한 사냥개 성능을 달성하였다.
- 알고리즘이 표본표 IRL 방법이 적용 불가능한 너무 큰 게임에서도 보상 함수와 정책을 성공적으로 복원하여 확장성의 가능성을 입증하였다.
- 성능 격차 최소화 목표 함수는 부분 최적 전문가 시범이 존재하는 상황에서도 더 높은 품질의 정책 복원을 이끌어내었다.
- 적대적 훈련 목표 함수가 국소 최적점이 없음을 입증하여 안정적이고 전역 수렴 가능한 학습을 지원함을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.