Skip to main content
QUICK REVIEW

[논문 리뷰] Bandit Online Learning of Nash Equilibria in Monotone Games

Tatiana Tatarenko, Maryam Kamgarpour|arXiv (Cornell University)|2020. 09. 08.
Advanced Bandit Algorithms Research참고 문헌 20인용 수 6
한 줄 요약

이 논문은 강한 단조성 조건이 필요로 하지 않고 더 약한 단조성 조건 하에서 나시 균형으로 수렴하는 다중 에이전트 볼록 게임을 위한 밴딧 온라인 학습 알고리즘을 제안한다. 각 에이전트는 다른 이의 비용 함수나 전략에 대한 지식 없이, 놀린 행동에서의 국소적 비용 함수 값만을 사용하여 학습한다. 이는 제로섬 게임, 혼합 확장, 선형 제약 조건이 있는 게임 등에 더 넓은 적용 가능성을 제공한다.

ABSTRACT

We address online bandit learning of Nash equilibria in multi-agent convex games. We propose an algorithm whereby each agent uses only obtained values of her cost function at each joint played action, lacking any information of the functional form of her cost or other agents' costs or strategies. In contrast to past work where convergent algorithms required strong monotonicity, we prove that the algorithm converges to a Nash equilibrium under mere monotonicity assumption. The proposed algorithm extends the applicability of bandit learning in several games including zero-sum convex games with possibly unbounded action spaces, mixed extension of finite-action zero-sum games, as well as convex games with linear coupling constraints.

연구 동기 및 목표

  • 에이전트들이 자신의 비용 함수나 다른 이들의 비용 함수의 함수 형태에 접근할 수 없는 다중 에이전트 볼록 게임을 위한 밴딧 학습 알고리즘을 개발하는 것.
  • 이전 연구에서 요구하는 강한 단조성 대신 최소한의 단조성 조건 하에서도 나시 균형으로 수렴하는 것을 달성하는 것.
  • 밴딧 학습의 적용 범위를 제로섬 볼록 게임(행동 공간이 유계가 아님)과 선형 결합 제약 조건이 있는 게임을 포함한 더 넓은 클래스의 게임으로 확장하는 것.
  • 각 에이전트가 유일하게 관측한 비용 값에 의존하여, 전역 정보나 기울기 접근 없이 탈중앙화된 학습을 가능하게 하는 것.
  • 伝통적 온라인 학습 방법이 정보가 부족하여 실패하는 설정에서 수렴에 대한 이론적 보장을 제공하는 것.

제안 방법

  • 각 에이전트는 연합 행동에서 자신의 비용 함수 값만 관측하는 밴딧 피드백 메커니즘을 사용하며, 기울기나 함수 형태에 대한 접근 없이 진행된다.
  • 관측된 비용 값만을 사용하여 온라인 기울기 하강 스타일의 갱신 규칙을 적용하고, 제한된 피드백 환경에 맞게 밴딧 설정에 적응시킨다.
  • 수렴 증명은 게임의 연산자의 단조성을 기반으로 하며, 이는 최적 반응 역학이 나시 균형 쪽으로 향하게 한다는 것을 보장한다.
  • 각 에이전트가 다른 이들의 전략에 대한 지식이나 조율 없이 자신의 관측된 비용 값만으로 전략을 갱신하는 탈중앙화된 설계를 한다.
  • 무한 행동 공간과 선형 결합 제약 조건을 다루기 위해 적절한 투영 및 정규화 기법을 통합한다.
  • 이론적 분석은 강한 단조성이나 완전한 정보가 필요로 하지 않는 단조성 조건 하에서도 나시 균형으로의 수렴을 보장한다.

실험 결과

연구 질문

  • RQ1비용 함수 형태를 알지 못하면서도 밴딧 피드백만으로 다중 에이전트 볼록 게임에서 나시 균형 수렴을 달성할 수 있는가?
  • RQ2이전 연구에서 요구하는 강한 단조성 대신 더 약한 조건인 단조성 조건 하에서도 알고리즘이 수렴하는가?
  • RQ3제안된 방법은 행동 공간이 무한한 제로섬 볼록 게임에 적용될 수 있는가?
  • RQ4선형 결합 제약 조건이 있는 게임에서 국소적 비용 관측만으로도 수렴이 보장되는가?
  • RQ5전체 정보나 강한 단조성을 요구하는 이전 방법과 비교해 탈중앙화된 밴딧 학습 접근법은 어떻게 다른가?

주요 결과

  • 강한 단조성 조건이 필요로 하지 않는 단조성 조건 하에서도 알고리즘이 나시 균형으로 수렴함을 입증함. 이는 이전 방법에서 요구하는 조건보다 엄밀히 더 약한 조건이다.
  • 관측된 연합 행동에서의 국소적 비용 함수 값만으로도 수렴이 달성되며, 기울기나 함수 형태에 대한 접근이 필요로 하지 않는다.
  • 행동 공간이 무한한 제로섬 볼록 게임에도 적용 가능하여, 이러한 설정에서 밴딧 학습의 적용 범위를 확장한다.
  • 유한 행동 제로섬 게임의 혼합 확장에도 유효하여, 랜덤화된 전략을 포함한 게임에서의 밴딧 학습을 가능하게 한다.
  • 선형 결합 제약 조건이 있는 볼록 게임에서도 단조성 조건 하에서 수렴을 유지함.
  • 이론적 분석은 조율이나 전역 정보가 필요로 하지 않음을 확인하여, 탈중앙화된 구현을 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.