Skip to main content
QUICK REVIEW

[논문 리뷰] Trading-Off Static and Dynamic Regret in Online Least-Squares and Beyond

Jianjun Yuan, Andrew Lamperski|arXiv (Cornell University)|2019. 09. 06.
Advanced Bandit Algorithms Research참고 문헌 18인용 수 5
한 줄 요약

이 논문은 할인 인자와 함께 할인된 온라인 뉴턴 방법을 분석하여 비정상적인 데이터 스트림에서 정적 및 동적 위험의 트레이드오프를 위한 통합 프레임워크를 제안한다. 적절한 튜닝을 통해 이러한 알고리즘은 동적 위험가 $\max\{O(\log T), O(\sqrt{TV})\}$를 달성하며, 여기서 $V$는 비교자 시퀀스의 경로 길이이다. 또한 경사하강법의 적응형 스텝 사이즈 규칙을 통해 정적 위험과 동적 위험 간의 트레이드오프를 가능하게 한다.

ABSTRACT

Recursive least-squares algorithms often use forgetting factors as a heuristic to adapt to non-stationary data streams. The first contribution of this paper rigorously characterizes the effect of forgetting factors for a class of online Newton algorithms. For exp-concave and strongly convex objectives, the algorithms achieve the dynamic regret of $\max\{O(\log T),O(\sqrt{TV})\}$, where $V$ is a bound on the path length of the comparison sequence. In particular, we show how classic recursive least-squares with a forgetting factor achieves this dynamic regret bound. By varying $V$, we obtain a trade-off between static and dynamic regret. In order to obtain more computationally efficient algorithms, our second contribution is a novel gradient descent step size rule for strongly convex functions. Our gradient descent rule recovers the order optimal dynamic regret bounds described above. For smooth problems, we can also obtain static regret of $O(T^{1-β})$ and dynamic regret of $O(T^βV^*)$, where $β\in (0,1)$ and $V^*$ is the path length of the sequence of minimizers. By varying $β$, we obtain a trade-off between static and dynamic regret.

연구 동기 및 목표

  • 비정상적인 데이터 스트림에 대한 재귀적 최소제곱 알고리즘에서 할인 인자의 영향을 엄밀하게 분석하기 위해.
  • 정적 위험(정상적인 환경에 대한 일반화)과 동적 위험(변화하는 환경의 추적) 간의 트레이드오프를 수립하기 위해.
  • 강凸성과 미끄러움을 만족하는 함수에 대해 순서 최적의 동적 위험 경계를 달성하는 계산적으로 효율적인 경사하강법의 스텝 사이즈 규칙을 개발하기 위해.
  • 할인 프레임워크 아래에서 온라인 뉴턴 방법과 재귀적 최소제곱을 분석하는 통합을 이루기 위해.
  • 통계적 가정 없이도 성능 보장을 가능하게 하는 최적의 시퀀스 $\theta_t^*$의 경로 길이 $V^*$에 따라 위험 경계를 제공하기 위해.

제안 방법

  • 할인 인자와 함께 하는 할인된 온라인 뉴턴 알고리즘을 제안하여, 할인 인자와 함께 하는 재귀적 최소제곱과 원래의 온라인 뉴턴 방법을 일반화한다.
  • 과거 관측치를 가중치로 부여하기 위해 할인 매개변수 $\gamma \in (0,1)$를 사용하여 비정상적인 환경에 적응할 수 있도록 한다.
  • 브레그만 발산과 헤시안 근사 행렬 $P_t$의 진화를 분석하여 위험 경계를 유도한다.
  • 경로 길이 $V^*$와 부드러움 매개변수 $\beta$에 따라 의존하는 새로운 경사하강법의 스텝 사이즈 규칙을 도입하여 정적 위험과 동적 위험 간의 트레이드오프를 가능하게 한다.
  • 누적 위험을 初기 오차, 기울기 노름, 헤시안 역행렬의 감쇠에 따라 bound하기 위해 라파노프 스타일 분석을 적용한다.
  • 행렬 농도와 고유값 경계를 사용하여 헤시안 근사의 조건수를 제어하고 수렴을 보장한다.

실험 결과

연구 질문

  • RQ1재귀적 최소제곱에서 할인 인자는 동적 위험 측면에서 엄밀하게 분석될 수 있으며, 그 결과로 도출되는 경계는 무엇인가?
  • RQ2단일 알고리즘이 정상적인 환경에서의 정적 위험와 비정상적인 환경에서의 동적 위험를 균형 잡을 수 있는가?
  • RQ3강凸성과 부드러움을 만족하는 함수에 대해 정적 위험와 동적 위험 간의 최적 트레이드오프는 무엇인가?
  • RQ4계산적으로 효율적인 경사하강법 규칙이 더 복잡한 온라인 뉴턴 방법과 동일한 순서 최적의 위험 경계를 달성할 수 있는가?
  • RQ5최적의 시퀀스 $\theta_t^*$의 경로 길이 $V^*$는 온라인 학습에서 동적 위험에 어떻게 영향을 미치는가?

주요 결과

  • 할인된 온라인 뉴턴 방법은 지수-concave 및 강凸성 있는 목표 함수에 대해 동적 위험 $\mathcal{R}_d \leq \max\{O(\log T), O(\sqrt{TV})\}$를 달성하며, 여기서 $V$는 비교자 시퀀스의 경로 길이다.
  • 기존의 할인 인자를 가진 재귀적 최소제곱 알고리즘도 동일한 동적 위험 경계를 달성하여, 그 히우리스틱적 사용에 대한 엄밀한 정당성을 제공한다.
  • 할인 인자 $\gamma = 1 - 1/T^\alpha$로 튜닝함으로써 알고리즘은 정적 위험 $\mathcal{R}_s = O(T^{1-\alpha})$를 달성하며, $\alpha \in (0,1)$에서 정적 및 동적 성능 간의 트레이드오프를 가능하게 한다.
  • 부드러운 문제에 대해서는 제안된 경사하강법 규칙이 정적 위험 $O(T^{1-\beta})$와 동적 위험 $O(T^\beta V^*)$를 달성하며, $\beta \in (0,1)$에서 $V^*$는 최적의 시퀀스 $\theta_t^*$의 경로 길이다.
  • 노이즈나 데이터 분포에 대한 통계적 가정 없이도 분석이 유지되어, 적대적 및 비스토크라틱 환경에 적용 가능하다.
  • 이 방법은 할인 최적화 프레임워크 아래에서 온라인 뉴턴 방법, 재귀적 최소제곱, 적응형 경사하강법을 연결하는 통합 프레임워크를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.