Skip to main content
QUICK REVIEW

[논문 리뷰] Model-Based Opponent Modeling

Xiaopeng Yu, Jiechuan Jiang|arXiv (Cornell University)|2021. 08. 04.
Reinforcement Learning in Robotics참고 문헌 38인용 수 9
한 줄 요약

이 논문은 환경 모델을 사용하여 적대적 정책 개선을 반복적으로 시뮬레이션하고, 이를 베이지안 혼합을 통해 통합함으로써 다양한 적대자에게 적응하는 모델 기반 적대자 모델링(MBOM)을 제안한다. MBOM은 고정된, 학습하는, 추론하는 적대자들이 포함된 경쟁적 과제에서 강력한 기준 모델들을 능가하며, 비정상적인 다중 에이전트 환경에서 뛰어난 적응 능력을 보여준다.

ABSTRACT

When one agent interacts with a multi-agent environment, it is challenging to deal with various opponents unseen before. Modeling the behaviors, goals, or beliefs of opponents could help the agent adjust its policy to adapt to different opponents. In addition, it is also important to consider opponents who are learning simultaneously or capable of reasoning. However, existing work usually tackles only one of the aforementioned types of opponents. In this paper, we propose model-based opponent modeling (MBOM), which employs the environment model to adapt to all kinds of opponents. MBOM simulates the recursive reasoning process in the environment model and imagines a set of improving opponent policies. To effectively and accurately represent the opponent policy, MBOM further mixes the imagined opponent policies according to the similarity with the real behaviors of opponents. Empirically, we show that MBOM achieves more effective adaptation than existing methods in a variety of tasks, respectively with different types of opponents, i.e., fixed policy, naïve learner, and reasoning learner.

연구 동기 및 목표

  • 비정상적인 다중 에이전트 환경에서 적대자 정책이 고정되어 있거나 학습 중이거나 추론 중일 수 있는 다양한, 예측할 수 없는 적대자에게 적응하는 문제를 해결하기 위해.
  • 적대자 학습 알고리즘이나 행동에 대한 사전 지식을 가정하지 않고도 적대자 정책 개선을 모델링하는 통합 프레임워크를 개발하기 위해.
  • 반복적 추론을 시뮬레이션하고 적대자 정책 추정치를 개선하여 경쟁적 및 협력적 다중 에이전트 환경 모두에서 효과적인 적응을 가능하게 하기 위해.

제안 방법

  • MBOM는 환경 모델을 사용하여 상호작용을 시뮬레이션하고, 반복적 상상을 통해 증가하는 수준의 적대자 추론을 반영하는 상상된 적대자 정책(IOPs)의 계층을 생성한다.
  • 각 상상된 적대자 정책는 에이전트 정책에 대한 최적 반응을 시뮬레이션한 후, 이러한 시뮬레이션된 궤적을 사용해 적대자 모델을 피지테이닝함으로써 생성된다.
  • 이 방법은 유사도에 기반해 실제 적대자 행동과의 유사도를 고려해 다수의 IOP를 가중 혼합하는 베이지안 혼합을 사용하여 정책 추정 정확도를 향상시킨다.
  • 에이전트의 정책는 가중된 IOP 조합에 조건화되어, 알려지지 않은 적대자 유형에 동적으로 적응할 수 있도록 한다.
  • 단일 적대자 모델링과 일관성을 유지하면서도, 다수의 적대자를 공동 적대자로 간주함으로써 다수의 적대자에 대해 확장 가능하다.
  • MBOM는 엔드 투 엔드로 훈련되며, 아키텍처 수정 없이도 경쟁적 및 협력적 과제에 모두 적용 가능하다.

실험 결과

연구 질문

  • RQ1학습 규칙에 대한 사전 가정 없이도 모델 기반 접근이 다양한 적대자, 특히 학습 및 추론 에이전트의 정책 개선을 효과적으로 시뮬레이션하고 표현할 수 있는가?
  • RQ2적대자 정책의 반복적 상상은 비정상적인 다중 에이전트 환경에서 에이전트의 적응 능력을 어떻게 향상시키는가?
  • RQ3가장 단순한 혼합 방식이나 단일 수준 혼합 방식에 비해 상상된 적대자 정책의 베이지안 혼합이 정책 추정 정확도 향상에 얼마나 기여하는가?
  • RQ4MBOM은 협력적 다중 에이전트 과제로 일반화될 수 있으며, 이러한 환경에서 기존 방법들과 비교해 어떻게 성능을 내는가?
  • RQ5특히 적대자들이 동시에 학습하거나 추론할 때, MBOM은 적대자 행동 변화에 얼마나 강건한가?

주요 결과

  • MBOM은 Meta-PG, Meta-MAPG, LOLA-DiCE와 같은 강력한 기준 모델들을 압도적으로 능가하며, 특히 사냥사냥개 환경에서 추론 학습자와의 경쟁 과제에서 뛰어난 성능을 보였다.
  • 절단 실험 결과, 반복적 상상과 베이지안 혼합이 모두 필수적임을 확인했다: MBOM-ϕ₁과 MBOM-ϕ₂는 MBOM-ϕ₀를 능가했으며, 베이지안 혼합은 항상 균일한 혼합보다 우수했다.
  • 코인 게임 협력 과제에서 MBOM은 PPO를 약간 앞서며, 성능 저하 없이도 협력 설정에 효과적으로 적용될 수 있음을 보여주었다.
  • 협력적 상황에서 MBOM는 Meta-PG와 Meta-MAPG보다 더 뛰어난 성능을 보였으며, 이는 훈련 데이터 부족으로 인해 이들이 탐욕적 정책으로 악화되기 때문이다.
  • MBOM는 학습하는 적대자에게 효과적으로 적응함을 보여주었으며, 사냥사냥개 환경에서의 접촉 횟수 감소로 확인되었고, LOLA-DiCE나 Meta-PG와 같은 기준 모델들은 정책 변화에 대응하지 못했다.
  • 실험 결과, MBOM는 적대자 행동이나 학습 알고리즘에 대한 사전 지식 없이도 고정된, 단순 학습자, 추론 학습자 등 다양한 적대자 유형으로 일반화됨을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.