Skip to main content
QUICK REVIEW

[논문 리뷰] Follow the Perturbed Leader: Optimism and Fast Parallel Algorithms for Smooth Minimax Games

Arun Sai Suggala, Praneeth Netrapalli|arXiv (Cornell University)|2020. 06. 13.
Advanced Bandit Algorithms Research참고 문헌 11인용 수 4
한 줄 요약

이 논문은 예측 가능한 손실 함수가 존재할 경우 최적의 worst-case regret을 유지하면서도 예측 가능성에 기반한 낙관적 전략을 통합함으로써 성능을 향상시키는 새로운 온라인 학습 알고리즘인 Optimistic Follow the Perturbed Leader (OFTPL)을 제안한다. 이 알고리즘은 단지 $O(T^{1/2})$개의 병렬 반복과 $T$개의 오라클 호출을 사용하여 매끄러운 미니맥스 게임에서 $O(T^{-1/2})$ 수렴 속도를 달성하며, 이는 이전 방법들에 비해 훨씬 높은 병렬 처리 가능성을 제공한다.

ABSTRACT

We consider the problem of online learning and its application to solving minimax games. For the online learning problem, Follow the Perturbed Leader (FTPL) is a widely studied algorithm which enjoys the optimal $O(T^{1/2})$ worst-case regret guarantee for both convex and nonconvex losses. In this work, we show that when the sequence of loss functions is predictable, a simple modification of FTPL which incorporates optimism can achieve better regret guarantees, while retaining the optimal worst-case regret guarantee for unpredictable sequences. A key challenge in obtaining these tighter regret bounds is the stochasticity and optimism in the algorithm, which requires different analysis techniques than those commonly used in the analysis of FTPL. The key ingredient we utilize in our analysis is the dual view of perturbation as regularization. While our algorithm has several applications, we consider the specific application of minimax games. For solving smooth convex-concave games, our algorithm only requires access to a linear optimization oracle. For Lipschitz and smooth nonconvex-nonconcave games, our algorithm requires access to an optimization oracle which computes the perturbed best response. In both these settings, our algorithm solves the game up to an accuracy of $O(T^{-1/2})$ using $T$ calls to the optimization oracle. An important feature of our algorithm is that it is highly parallelizable and requires only $O(T^{1/2})$ iterations, with each iteration making $O(T^{1/2})$ parallel calls to the optimization oracle.

연구 동기 및 목표

  • 예측 가능한 손실 시퀀스를 활용할 수 있는 능력이 현재의 Follow the Perturbed Leader (FTPL) 알고리즘에서는 예측 가능성 하에 더 낫지 않은 리그레트 경계를 제공할 뿐, 최악의 경우 리그레트에 대해서만 최적성을 확보하고 있다는 한계를 해결하기 위해.
  • 예측 가능성에 기반한 개선된 리그레트 보장을 달성하면서도 최악의 경우에 대한 강건성을 유지하는 FTPL의 변종인 Optimistic FTPL (OFTPL)을 개발하기 위해.
  • 매끄러운 볼록-볼록 및 비볼록-비볼록 미니맥스 게임을 빠르게 해결하기 위한 고도로 병렬 처리 가능한 알고리즘을 설계하기 위해.
  • GAN 및 적대적 훈련과 같은 응용 분야에서 대규모 훈련을 효율적으로 가능하게 하기 위해 반복 횟수를 줄이고 오라클의 병렬 접근을 가능하게 하기 위해.

제안 방법

  • 과거 정보를 활용해 미래의 손실 함수를 낙관적으로 예측하는 방식으로 FTPL를 수정한 OFTPL을 제안한다.
  • 편향을 정규화의 이중적 시각으로 간주하여 알고리즘의 확률적 및 낙관적 성분을 분석한다.
  • 매끄러운 볼록-볼록 게임의 경우 선형 최적화 오라클을 활용하고, 비볼록-비볼록 게임의 경우 편향된 최적 반응 오라클을 사용한다.
  • 오라클 최적화 기반 반복 횟수 $O(T^{1/2})$로 $O(T^{-1/2})$ 수렴 속도를 달성하며, 각 반복에서 $O(T^{1/2})$개의 병렬 오라클 호출을 수행한다.
  • 분석에서 리그레트와 분산을 균형 있게 조절하기 위해 정규화 파rameter $\eta$와 오라클 샘플링 크기 $m$을 신중하게 조정한다.
  • Fenchel 쌍대성과 강한 볼록성/매끄러움 성질을 활용하여 리그레트 경계를 유도하며, 근거로 Theorem H.5와 H.6를 활용한다.

실험 결과

연구 질문

  • RQ1손실 함수가 예측 가능할 경우 FTPL에 낙관적 전략을 통합하면 최악의 경우 성능이 떨어지지 않으면서도 리그레트 경계를 향상시킬 수 있는가?
  • RQ2편향을 정규화의 이중적 시각으로 간주할 때, OFTPL의 확률적 및 낙관적 성분은 어떻게 분석할 수 있는가?
  • RQ3온라인 미니맥스 게임 해법에서 수렴 속도, 반복 횟수, 병렬 처리 간의 최적의 트레이드오프는 무엇인가?
  • RQ4기존 방법에 비해 훨씬 적은 반복 횟수로 OFTPL이 $O(T^{-1/2})$ 수렴 속도를 달성하면서도 오라클 효율성을 유지할 수 있는가?
  • RQ5미니맥스 게임에 대해 FTRL 기반 낙관적 알고리즘과 비교했을 때 OFTPL의 리그레트 보장 및 계산 효율성은 어떠한가?

주요 결과

  • OFTPL은 미니맥스 게임에서 양 측면의 플레이어 모두에 대해 $O(d^2 D^2 (L+1) \log d + G D \sqrt{\log(8/\delta)}) + O(\min(D^2 L T, \frac{d^2 G^2 \log T}{L} + \frac{d G^2 \log(8/\delta)}{L}))$의 리그레트 경계를 달성한다.
  • 알고리즘은 오라클 최적화 호출을 총 $T$회 수행하여 뿐만 아니라 $T$개의 오라클 호출만으로도 $O(T^{-1/2})$ 정확도의 해에 수렴한다.
  • 단지 $O(T^{1/2})$회의 반복과 각 반복에서 $O(T^{1/2})$개의 병렬 오라클 호출을 필요로 하여 높은 병렬 처리 가능성을 확보한다.
  • 분석을 통해 편향이 정규화 역할을 하며, 낙관적 접근을 통해 더 날카운 리그레트 경계를 달성할 수 있음을 입증한다.
  • 매끄러운 볼록-볼록 게임의 경우 선형 최적화 오라클만 필요하고, 비볼록-비볼록 게임의 경우 편향된 최적 반응 오라클만으로도 충분하다.
  • 손실 함수가 예측 불가능할 경우에도 표준 FTPL의 $O(T^{1/2})$ 최악의 경우 리그레트 보장을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.