Skip to main content
QUICK REVIEW

[논문 리뷰] Online Game with Time-Varying Coupled Inequality Constraints

Min Meng, Xiuxian Li|arXiv (Cornell University)|2023. 06. 28.
Advanced Bandit Algorithms ResearchDecision Sciences인용 수 3
한 줄 요약

이 논문은 시간에 따라 변화하는 결합 불등식 제약 조건을 가진 게임에 대해 분산형 온라인 학습 알고리즘을 제안하며, 미러 디센트와 원천-이중 업데이트를 사용하여 하한선 이상의 회귀와 제약 위반을 달성한다. 강한 단조성 조건 하에서 변분 일반화 내쉬 균형으로 수렴함을 증명하였으며, 밴딧 피드백 설정으로의 확장도 이루어졌다.

ABSTRACT

In this paper, online game is studied, where at each time, a group of players aim at selfishly minimizing their own time-varying cost function simultaneously subject to time-varying coupled constraints and local feasible set constraints. Only local cost functions and local constraints are available to individual players, who can share limited information with their neighbors through a fixed and connected graph. In addition, players have no prior knowledge of future cost functions and future local constraint functions. In this setting, a novel decentralized online learning algorithm is devised based on mirror descent and a primal-dual strategy. The proposed algorithm can achieve sublinearly bounded regrets and constraint violation by appropriately choosing decaying stepsizes. Furthermore, it is shown that the generated sequence of play by the designed algorithm can converge to the variational GNE of a strongly monotone game, to which the online game converges. Additionally, a payoff-based case, i.e., in a bandit feedback setting, is also considered and a new payoff-based learning policy is devised to generate sublinear regrets and constraint violation. Finally, the obtained theoretical results are corroborated by numerical simulations.

연구 동기 및 목표

  • 미래의 비용이나 전역 제약 조건에 대한 정보를 갖지 못하는 분산 환경에서 시간에 따라 변화하는 비용 함수와 결합 제약 조건을 가진 온라인 게임를 다루기 위해.
  • 국소 비용 함수, 국소 제약 조건, 그리고 고정된 연결 그래프를 통한 이웃 간 통신에만 의존하는 분산형 온라인 학습 알고리즘을 설계하기 위해.
  • 시간에 따라 변화하는 제약 조건과 제한된 피드백이 존재하는 상황에서 하한선 이상의 회귀와 제약 위반에 대한 이론적 보장을 확립하기 위해.
  • 오직 수익(함수 값) 정보만 제공되고 기울기가 제공되지 않는 밴딧 피드백 설정으로 프레임워크를 확장하기 위해.
  • 강한 단조성 가정 하에서 생성된 플레이 시퀀스가 변분 일반화 내쉬 균형(v-GNE)으로 수렴함을 증명하기 위해.

제안 방법

  • 시간에 따라 변화하는 결합 불등식 제약 조건과 국소 탇성 집합을 다루기 위해 미러 디센트와 원천-이중 전략을 활용한 새로운 분산형 온라인 학습 알고리즘을 설계하였다.
  • 회귀와 제약 위반의 균형을 확보하기 위해 감쇠하는 스텝 사이즈를 사용하여 시간에 따라 하한선 이상의 성장이 이루어지도록 하였다.
  • 국소 기울기 추정과 이중 변수 업데이트를 통합하여 시간에 따라 변화하는 제약 조건을 추적하였으며, 리아푸노프 유사 함수와 재귀 부등식을 통한 수렴 분석을 수행하였다.
  • 밴딧 피드백 케이스에서는 단일 관측점에서 기울기 정보를 추론하는 새로운 수익 기반 학습 정책을 도입하여 기울기 접근 없이도 회귀와 제약 위반의 경계를 확보할 수 있도록 하였다.
  • 핵심 구성 요소로는 감쇠하는 수열(αₜ, βₜ, γₜ, δₜ)을 통한 스텝 사이즈 사용, 이중 변수 추적, 조건부 기대값과 리프시츠 연속성 가정을 활용한 오차 분해가 포함되어 있다.
  • 이론적 분석은 조건부 기대값을 포함한 부등식과 기울기 및 제약 함수 추정 오차의 경계를 활용하며, 조정 파rameter에 따라 회귀 및 위반 경계를 도출한다.

실험 결과

연구 질문

  • RQ1시간에 따라 변화하는 결합 제약 조건과 제한된 정보를 가진 시간에 따라 변화하는 온라인 게임에서 분산형 온라인 학습 알고리즘이 하한선 이상의 회귀와 제약 위반을 달성할 수 있는가?
  • RQ2시간에 따라 변화하는 제약 조건과 미래 비용에 대한 사전 지식이 없는 분산형 온라인 게임에서 플레이어는 어떻게 변분 일반화 내쉬 균형(v-GNE)으로 수렴할 수 있는가?
  • RQ3오직 함수 값만 관측되고 기울기가 제공되지 않는 밴딧 피드백 설정에서 알고리즘의 성능 보장은 무엇인가?
  • RQ4감쇠하는 스텝 사이즈는 제안된 알고리즘에서 회귀와 제약 위반 간의 트레이드오프에 어떤 영향을 미치는가?
  • RQ5플레이 시퀀스가 v-GNE로 수렴하는 조건는 무엇이며, 강한 단조성이 이 수렴 과정에서 어떤 역할을 하는가?

주요 결과

  • 완전한 정보 피드백 하에서, 알고리즘은 𝒪(∑(δᵢ,ₜ + γₜ + αₜ/δᵢ,ₜ + αₜ/βₜ² + δₜ/βₜ) + 1/αₜ) 이하의 하한선 이상의 회귀를 달성한다.
  • 제약 위반은 𝒪(∑(δₜ/βₜ) + (𝔼[R_g(T)])²/B₃(T)) 이하로 경계된다. 여기서 R_g(T)는 총 제약 위반을 나타낸다.
  • 스텝 사이즈를 αₜ = 𝒪(1/√t), βₜ = 𝒪(1/t), δₜ = 𝒪(1/t)로 선택할 경우, 회귀와 제약 위반 모두 시간 T에 대해 하한선 이상으로 증가한다.
  • 강한 단조성 조건 하에서, 알고리즘이 생성한 플레이 시퀀스는 기저 게임의 변분 일반화 내쉬 균형(v-GNE)으로 수렴한다.
  • 밴딧 피드백 설정에서는 오직 함수 값만 관측되지만, 수익 기반 학습 정책이 하한선 이상의 회귀와 제약 위반을 달성한다.
  • 수치 시뮬레이션은 이론적 결과를 지지하며, 시간이 지남에 따라 낮은 회귀와 제약 위반을 달성하는 알고리즘의 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.