Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Point Bandit Algorithms for Nonstationary Online Nonconvex Optimization

Abhishek Roy, Krishnakumar Balasubramanian|arXiv (Cornell University)|2019. 07. 31.
Advanced Bandit Algorithms Research참고 문헌 49인용 수 6
한 줄 요약

이 논문은 비정상적인 온라인 비볼록 최적화를 위한 다중점 밴딧 알고리즘을 소개하며, 일阶 및 이阶 정류점 해와 함수 값에 기반한 새로운 리그레트 측도를 제안한다. 저자는 저차원 및 고차원 설정 모두에서 하위선형 리그레트 경계를 확립하였으며, 약한 준볼록성과 단조성 있는 약한 부분모듈라 함수에 대해 일정 리그레트 결과를 도출하였다. 또한, 헤시안 행렬 추정을 위한 이阶 가우시안 스티븐의 항등식을 활용한, 큐빅 정규화 뉴턴 방법의 밴딧 버전을 개발하였다.

ABSTRACT

Bandit algorithms have been predominantly analyzed in the convex setting with function-value based stationary regret as the performance measure. In this paper, motivated by online reinforcement learning problems, we propose and analyze bandit algorithms for both general and structured nonconvex problems with nonstationary (or dynamic) regret as the performance measure, in both stochastic and non-stochastic settings. First, for general nonconvex functions, we consider nonstationary versions of first-order and second-order stationary solutions as a regret measure, motivated by similar performance measures for offline nonconvex optimization. In the case of second-order stationary solution based regret, we propose and analyze online and bandit versions of the cubic regularized Newton's method. The bandit version is based on estimating the Hessian matrices in the bandit setting, based on second-order Gaussian Stein's identity. Our nonstationary regret bounds in terms of second-order stationary solutions have interesting consequences for avoiding saddle points in the bandit setting. Next, for weakly quasi convex functions and monotone weakly submodular functions we consider nonstationary regret measures in terms of function-values; such structured classes of nonconvex functions enable one to consider regret measure defined in terms of function values, similar to convex functions. For this case of function-value, and first-order stationary solution based regret measures, we provide regret bounds in both the low- and high-dimensional settings, for some scenarios.

연구 동기 및 목표

  • 비정상적인 온라인 비볼록 최적화에 대한 밴딧 알고리즘이 부족한 점을 보완하기 위해.
  • 볼록 설정에서 정류점 리그레트 분석을 일반 및 구조화된 비볼록 함수 설정으로 확장하기 위해.
  • 기울기 정보 없이도 기울기와 헤시안을 추정할 수 있는 밴딧 우호적인 방법을 개발하기 위해.
  • 저차원의 경우 차원에 대해 다항수적으로, 고차원 희소 설정의 경우 다중로그 형태로 척도가 조절되는 리그레트 경계를 제공하기 위해.
  • 스토케스틱 및 비스토케스틱 피드백 하에서, 일阶 및 이阶 정류점 해와 함수 값에 기반한 비정상적 리그레트를 분석하기 위해.

제안 방법

  • 기울기 크기와 이阶 정류점 해에 기반한 비정상적 리그레트 측도를 제안하여, 오프라인 비볼록 최적화 개념을 온라인 밴딧 설정으로 확장한다.
  • 함수 값 피드백에서 헤시안 행렬을 추정하기 위해 이阶 가우시안 스티븐의 항등식을 활용한 큐빅 정규화 뉴턴 방법의 밴딧 버전을 도입한다.
  • 기울기 정보가 없을 경우를 대비해 무작위 편향을 활용한 다중점 기울기 추정 기법을 사용하여 기울기와 헤시안을 근사한다.
  • 저차원 및 고차원 설정 모두에서 리그레트 경계를 유도하며, 후자의 경우 차원에 대한 다중로그 형태의 의존성을 확보하기 위해 구조적 희소성 가정에 기반한다.
  • 오차 전파를 제어하기 위해 조건부 기대값과 마틴게일 차분 수열을 활용한 스토케스틱 근사 프레임워크를 적용한다.
  • 리그레트 경계를 유도하기 위해 함수의 매끄러움, 기울기의 유계성, 최적점의 총 변동성(비정상성)에 대한 가정을 적용한다.

실험 결과

연구 질문

  • RQ1일반적인 비볼록 함수에 대해, 밴딧 설정에서 비정상적 리그레트를 의미 있게 정의하고 경계를 설정할 수 있는가?
  • RQ2함수 값 피드백만을 갖는 밴딧 설정에서 이阶 정류점 해를 어떻게 근사할 수 있는가?
  • RQ3약한 준볼록성 또는 부분모듈라성과 같은 구조적 가정 하에, 비정상적 비볼록 밴딧 최적화의 차원에 따라 달라지는 리그레트 경계는 무엇인가?
  • RQ4밴딧 알고리즘이 구조화된 비볼록 함수에 대해 비정상적 설정에서 일정 리그레트를 달성할 수 있는가?
  • RQ5이阶 정보(헤시안 추정)의 사용이 밴딧 비볼록 최적화에서 수렴성 향상과 안장점 회피에 어떻게 기여하는가?

주요 결과

  • 기울기 크기에 기반한 리그레트를 사용한 비정상적 밴딧 최적화에서, O(d√(T + TV_T))의 리그레트 경계를 확립하였으며, 이는 스토케스틱 및 결정론적 설정 모두에서 유효하다.
  • 약한 준볼록 함수의 경우, 희소성 가정 하에서 리그레트 경계가 차원에 대해 다중로그 형태로 척도가 조절되어 고차원 적용이 가능하다.
  • 밴딧 큐빅 정규화 뉴턴 방법은 이阶 정류점 해에 대해 하위선형 리그레트를 달성하며, 안장점 회피에 대한 이론적 보장을 제공한다.
  • 단조성 있는 약한 DR-부분모듈라 함수의 경우, 함수 값에 기반한 리그레트 경계를 도출하였으며, 곡률 매개변수 γ에 명시적인 의존성을 포함한다.
  • 동일한 가정 하에 스토케스틱 및 결정론적 설정 간 리그레트 경계가 동일하게 유지되어 피드백 노이즈에 대한 강건성을 보여준다.
  • 분석 결과, 구조적 희소성 가정을 통해 차원 의존성이 다항수에서 다중로그 형태로 감소함을 보여주어 고차원 문제의 확장성 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.