Skip to main content
QUICK REVIEW

[논문 리뷰] Gradient-free Online Learning in Games with Delayed Rewards

Amélie Héliou, Panayotis Mertikopoulos|arXiv (Cornell University)|2020. 06. 19.
Advanced Bandit Algorithms Research참고 문헌 38인용 수 6
한 줄 요약

이 논문은 연속된 행동 공간과 유계가 아닌 지연 보상이 있는 다중 플레이어 게임을 위한 무보상 학습 정책인 지연된 피드백을 고려한 무기울기 온라인 학습(GOLD)을 제안한다. SPSA 기반의 제로계층 기울기 추정과 이질적 피드백을 위한 우선순위 큐를 조합함으로써, GOLD는 임의의 지연 조건 하에서도 거의 확실히 나시 균형에 수렴함을 보장한다. 이는 피드백이 지연되고 순서가 어긋나는 온라인 광고 및 추천 시스템에서의 핵심 과제를 해결한다.

ABSTRACT

Motivated by applications to online advertising and recommender systems, we consider a game-theoretic model with delayed rewards and asynchronous, payoff-based feedback. In contrast to previous work on delayed multi-armed bandits, we focus on multi-player games with continuous action spaces, and we examine the long-run behavior of strategic agents that follow a no-regret learning policy (but are otherwise oblivious to the game being played, the objectives of their opponents, etc.). To account for the lack of a consistent stream of information (for instance, rewards can arrive out of order, with an a priori unbounded delay, etc.), we introduce a gradient-free learning policy where payoff information is placed in a priority queue as it arrives. In this general context, we derive new bounds for the agents' regret; furthermore, under a standard diagonal concavity assumption, we show that the induced sequence of play converges to Nash equilibrium with probability $1$, even if the delay between choosing an action and receiving the corresponding reward is unbounded.

연구 동기 및 목표

  • 연속된 행동 공간을 가진 다중 플레이어 게임에서 지연되고 이질적인 피드백 문제를 다루기 위해.
  • 행동과 보상 사이의 무한한 지연이 존재하더라도 무보상 학습 정책을 설계하기 위해.
  • 상대방의 전략이나 보상 함수에 대한 지식이 없더라도 최소한의 가정 하에 나시 균형으로 수렴함을 보장하기 위해.
  • 피드백의 순서가 어긋나거나 지연될 경우 발생하는 정보 불균형을 새로운 우선순위 큐 메커니즘을 통해 다루기 위해.
  • 임의의 무한한 지연 조건이 존재하는 상황에서의 보상과 수렴에 대한 이론적 보장을 확립하기 위해.

제안 방법

  • 기울기 계산을 제로계층 SPSA 추정기법으로 대체하는 온라인 기울기 하강 기반의 무기울기 온라인 학습 정책(GOLD)을 도입한다.
  • 지연된 피드백을 저장하고 관리하기 위해 우선순위 큐를 사용하며, 먼저 들어온 피드백부터 처리하는 선입선출(FIFO) 방식을 통해 정보 과부하를 방지한다.
  • 편미분 기반 기울기 추정을 사용하는 확률적 근사 프레임워크를 적용하여, 명시적인 기울기 접근 없이도 보상 함수의 기울기를 추정한다.
  • 보상 함수의 대각선 볼록성 특성을 활용하여, 리아푸노프 유사 분석을 통해 보상과 수렴을 제한한다.
  • 탐색과 수렴의 균형을 맞추기 위해 시간에 따라 변하는 스텝 사이즈와 편향 크기를 구현한다.
  • 마팅게일 수렴 논증을 통해 추정 오차와 피드백 지연이 균형 수렴을 방해하지 않음을 보여준다.

실험 결과

연구 질문

  • RQ1연속된 행동과 무한한 지연된 보상을 가진 다중 플레이어 게임에 대해 무보상 학습 정책을 설계할 수 있는가?
  • RQ2피드백이 순서가 어긋나거나 임의의 지연이 존재하더라도 그러한 정책이 나시 균형으로 수렴하는가?
  • RQ3온라인 게임에서 이질적, 지연되고 때로는 오래된 피드백이 존재할 경우 무기울기 학습을 어떻게 강건하게 만들 수 있는가?
  • RQ4이 설정에서 보상과 수렴에 대해 어떤 이론적 경계를 설정할 수 있는가?
  • RQ5피드백 구조에 대한 최소한의 가정 하에서도 균형으로의 수렴을 거의 확실히 보장할 수 있는가?

주요 결과

  • 제안된 GOLD 정책은 무한한 지연 조건 하에서도 무보상 학습을 달성하며, 보상 수렴에 대한 경계는 지연 분포와 스텝 사이즈 수열에 따라 달라진다.
  • 보상 함수에 표준적인 대각선 볼록성 가정을 두었을 때, 행동 시퀀스는 거의 확실히 나시 균형으로 수렴한다.
  • 행동과 보상 사이의 임의의 무한한 지연 조건 하에서도 수렴이 강건하게 유지되며, 피드백이 순서가 어긋나도 문제없이 작동한다.
  • 우선순위 큐 메커니즘은 오래된 피드백을 통제된 FIFO 방식으로 처리하여, 오래된 정보를 조기에 또는 과도하게 사용하는 것을 방지한다.
  • 분석을 통해 기울기 추정이 편향된 SPSA 방법을 사용하더라도 행동 시퀀스가 나시 균형으로 거의 확실히 수렴함을 보였다.
  • 마팅게일 수렴과 리아푸노프 스타일 논증을 통해 오차 항이 시간이 지남에 따라 거의 확실히 사라짐을 이론적으로 도출하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.