Skip to main content
QUICK REVIEW

[논문 리뷰] R2-B2: Recursive Reasoning-Based Bayesian Optimization for No-Regret Learning in Games

Zhongxiang Dai, Yizhou Chen|arXiv (Cornell University)|2020. 06. 30.
Machine Learning and Data Classification인용 수 15
한 줄 요약

이 논문은 제한된 이성과 자기 중심적인 에이전트가 참여하는 반복 게임에서의 no-regret 학습을 위한 R2-B2라는 재귀적 추론 기반 베이지안 최적화 프레임워크를 제안한다. R2-B2는 에이전트의 전략적 추론을 수준 ≥2 및 상대보다 한 단계 높은 수준에서 모델링함으로써 표준 BO보다 더 빠른 渐진 수렴 속도를 달성한다. 경량 버전인 R2-B2-Lite는 적대적 머신러닝 및 다중에이전트 강화학습 환경에서 강력한 경험적 방어 성능을 보인다.

ABSTRACT

This paper presents a recursive reasoning formalism of Bayesian optimization (BO) to model the reasoning process in the interactions between boundedly rational, self-interested agents with unknown, complex, and costly-to-evaluate payoff functions in repeated games, which we call Recursive Reasoning-Based BO (R2-B2). Our R2-B2 algorithm is general in that it does not constrain the relationship among the payoff functions of different agents and can thus be applied to various types of games such as constant-sum, general-sum, and common-payoff games. We prove that by reasoning at level 2 or more and at one level higher than the other agents, our R2-B2 agent can achieve faster asymptotic convergence to no regret than that without utilizing recursive reasoning. We also propose a computationally cheaper variant of R2-B2 called R2-B2-Lite at the expense of a weaker convergence guarantee. The performance and generality of our R2-B2 algorithm are empirically demonstrated using synthetic games, adversarial machine learning, and multi-agent reinforcement learning.

연구 동기 및 목표

  • 에이전트의 보상 함수가 알려져 있지 않고 복잡하며 평가에 비용이 많이 드는 반복 게임에서 no-regret 학습의 과제를 해결한다.
  • 인지계층 이론을 영감으로 받아, 제한된 이성적 에이전트의 전략적 추론을 재귀적 계층으로 모델링한다.
  • 다중 수준의 추론을 통합한 베이지안 최적화 프레임워크를 개발하여 no-regret 수렴 속도를 향상시킨다.
  • 상수합, 일반합, 공통보상 게임을 포함한 다양한 게임 유형에 일반성을 확보한다.
  • 계산 비용이 낮은 변형(R2-B2-Lite)을 제공하여 약한 보장이지만 여전히 효과적인 수렴 성능을 확보한다.

제안 방법

  • 에이전트의 재귀적 추론을 k단계 계층으로 공식화: 수준 0(랜덤화), 수준 k ≥ 1(수준 0에서 k−1까지의 에이전트 추론에 대한 최적 반응).
  • 에이전트 행동 공간에서 알려지지 않은 보상 함수를 예측하기 위해 가우시안 프로세스(GP) 대체 모델을 사용한 베이지안 최적화 통합.
  • 순차적 블랙박스 최적화에서 탐색과 이용의 균형을 확보하기 위해 GP-UCB 획득 함수 사용.
  • 각 반복 단계에서 R2-B2 에이전트는 상대의 행동을 자신의 가정된 추론 수준에 기반해 시뮬레이션하고 최적 반응을 선택한다.
  • R2-B2-Lite의 경우, 전체 재귀적 시뮬레이션 없이 상대 행동을 근사함으로써 추론 과정을 단순화한다.
  • 모든 에이전트가 전체 게임 역사 기록을 관찰하는 동시 이동 및 완전 관측 조건 하에서 반복 게임에 프레임워크를 적용한다.

실험 결과

연구 질문

  • RQ1베이지안 최적화에 재귀적 추론을 통합하면 보상 함수가 알려져 있지 않은 반복 게임에서 no-regret 수렴 속도를 가속화할 수 있는가?
  • RQ2수준 k ≥ 2 및 상대보다 한 단계 높은 수준에서의 추론은 비재귀적 BO 전략보다 더 빠른 수렴을 이끌어내는가?
  • RQ3R2-B2는 상수합, 일반합, 공통보상 게임을 포함한 다양한 게임 유형에서 어떻게 성능을 발휘하는가?
  • RQ4R2-B2-Lite는 전체 R2-B2에 비해 계산 비용을 줄이면서도 여전히 강력한 경험적 성능을 유지할 수 있는가?
  • RQ5R2-B2는 머신러닝 분야의 블랙박스 적대적 공격에 얼마나 효과적으로 대응할 수 있으며, 다중에이전트 강화학습에서 표본 효율성을 얼마나 향상시킬 수 있는가?

주요 결과

  • 에이전트가 수준 k ≥ 2 및 상대보다 한 단계 높은 수준에서 추론할 경우, R2-B2는 표준 베이지안 최적화보다 더 빠른 渐진 수렴 속도를 달성한다.
  • R2-B2-Lite는 계산 비용을 줄였지만 여전히 적대적 공격에 효과적으로 대응하여 150회 반복 동안 성공적인 공격를 각각 0.8과 0.7로 제한한다.
  • 적대적 머신러닝 환경에서 수준-1 R2-B2-Lite 방어자는 GP-UCB 및 톰슨 샘플링 기반 공격자 모두를 성공적으로 무력화했다.
  • 다중에이전트 강화학습 환경에서 R2-B2는 클리핑 및 스케일링된 보상이 [0,1] 범위에 포함된 55차원 파라미터 공간에서 효율적인 정책 탐색을 가능하게 했다.
  • 프레임워크는 합성 게임, 적대적 머신러닝, MARL 환경 전반에서 강력한 일반성과 내구성을 입증했으며, GP 초모수는 매 10회 반복마다 최적화되었다.
  • 정책 공간의 고차원성으로 인해 수준-0 전략으로 무작위 탐색을 사용하여 복잡한 환경에서 기준 탐색 성능을 확보했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.