Skip to main content
QUICK REVIEW

[논문 리뷰] Uniform regret bounds over $R^d$ for the sequential linear regression problem with the square loss

Pierre Gaillard, Sébastien Gerchinovitz|arXiv (Cornell University)|2018. 02. 16.
Advanced Bandit Algorithms Research참고 문헌 4인용 수 5
한 줄 요약

이 논문은 제곱 손실에 대해 $√{d}B^2 \ln T + O_T(1)$ 의 균일한 손해 한계를 달성하는 새로운 온라인 선형 회귀 알고리즘을 제안한다. 이는 $√{d}B^2 \ln T$ 항의 계수를 2에서 1로 개선하여 이전의 최상의 상한 $2\sqrt{d}B^2 \ln T$ 보다 향상된 결과를 얻는다. 이 방법은 비선형 리지 회귀 프레임워크 내에서 데이터에 의존하는 정규화를 사용하여, 고정 설계 및 순차적으로 노출되는 특징 설정 모두에서 $√{d}B^2 \ln T$ 항의 최적의 상수 1을 달성한다.

ABSTRACT

We consider the setting of online linear regression for arbitrary deterministic sequences, with the square loss. We are interested in the aim set by Bartlett et al. (2015): obtain regret bounds that hold uniformly over all competitor vectors. When the feature sequence is known at the beginning of the game, they provided closed-form regret bounds of $2d B^2 \\ln T + \\mathcal{O}_T(1)$, where $T$ is the number of rounds and $B$ is a bound on the observations. Instead, we derive bounds with an optimal constant of $1$ in front of the $d B^2 \\ln T$ term. In the case of sequentially revealed features, we also derive an asymptotic regret bound of $d B^2 \\ln T$ for any individual sequence of features and bounded observations. All our algorithms are variants of the online non-linear ridge regression forecaster, either with a data-dependent regularization or with almost no regularization.

연구 동기 및 목표

  • 균일한 손해에 대해 $√{d}B^2 \ln T$ 의 알려진 최소 최대 하한과 $2\sqrt{d}B^2 \ln T$ 의 최선의 기존 상한 사이의 격차를 좁히기.
  • 고정 설계 및 순차적으로 노출되는 특징 설정 모두에서 $√{d}B^2 \ln T$ 항의 최적 상수 1을 달성하는 손해 최소화 알고리즘 개발.
  • 관측치의 상한 $B$ 또는 수명 $T$ 를 사전에 알 필요 없이 최적의 손해를 달성할 수 있는 데이터에 의존하는 정규화 기법을 설계하면서 척도 불변성을 유지하기.
  • 이전의 역방향 계산 방법의 한계를 극복하고, 비선형 리지 회귀 예측기의 적용 가능성을 순차적으로 노출되는 특징 설정으로 확장하기.

제안 방법

  • 특징 벡터의 경험적 공분산에 적응하는 데이터에 의존하는 정규화 파rameter를 가진 비선형 리지 회귀 예측기의 변형을 제안.
  • Gram 행렬 $G_t = X_t X_t^T$ 의 고유구조에 기반한 동적 정규화 전략을 사용하여 예측 분산에 대한 최적의 제어를 확보.
  • 질량이 낮은 특징 행렬을 다루기 위해 Moore-Penrose 의사역행렬을 적용하고, 예측 규칙에 대한 닫힌 형태의 표현식을 유도.
  • 고유값의 교차성과 행렬 섭동 이론에 기반한 새로운 분석 기법을 적용하여, 예측 규칙의 손해를 역행렬 Gram 행렬의 트레이스로 제한.
  • 손해와 Gram 행렬의 행렬식 사이의 연결 고리를 설정하고, 축소된 행렬 $\Gamma$ 에 대해 $\det(\Gamma) = \prod_{k=1}^r \lambda_k(B)$ 인 식을 활용하여 날카운 제약 조건을 도출.
  • 알고리즘의 손해가 $√{d}B^2 \ln T + O_T(1)$ 로 균일하게 유계임을 입증하며, 이는 하위항을 제외한 최소 최대 하한과 일치한다.

실험 결과

연구 질문

  • RQ1고정 설계 및 순차적으로 노출되는 특징 설정 모두에서 온라인 선형 회귀의 균일한 손해를 $2\sqrt{d}B^2 \ln T$ 에서 $√{d}B^2 \ln T$ 로 개선할 수 있는가?
  • RQ2역방향 계산이나 $T$ 를 사전에 알 필요 없이 순차적으로 노출되는 특징 설정에서 이 최적의 손해 한계를 달성할 수 있는가?
  • RQ3특징의 유계성에 대한 가정 없이 척도 불변성을 유지하면서 최적의 손해를 달성할 수 있는 데이터에 의존하는 정규화 전략을 설계할 수 있는가?
  • RQ4Gram 행렬 $G_t$ 의 고유구조는 손해에 어떤 영향을 미치며, 이를 더 날카운 제약 조건을 유도하는 데 활용할 수 있는가?
  • RQ5최소한의 정규화로도 순차적 특징 설정에 적합하게 비선형 리지 회귀 프레임워크를 조정하여 최적의 손해를 달성할 수 있는가?

주요 결과

  • 제안된 알고리즘은 $√{d}B^2 \ln T + O_T(1)$ 의 균일한 손해 한계를 달성하며, 하위항을 제외한 최소 최대 하한과 일치한다.
  • $√{d}B^2 \ln T$ 항의 계수는 2에서 1로 개선되어 최적의 상수를 달성한다.
  • 알고리즘은 고정 설계 및 순차적으로 노출되는 특징 설정 모두에서 동일한 손해 보장을 제공한다.
  • 이 방법은 경험적 특징 분포에 적응하는 데이터에 의존하는 정규화를 사용하여 $B$ 또는 $T$ 를 사전에 알 필요 없이 작동한다.
  • 분석 결과, 손해는 축소된 Gram 행렬 $\Gamma$ 의 행렬식에 의해 날카롭게 제어되며, 이는 특징 공분산의 고유값과 관련이 있다.
  • 알고리즘은 척도 불변성을 유지하며, 특징이 순차적으로 노출될 때도 전진 방식으로 계산 가능하여 이전의 역방향 알고리즘의 한계를 극복한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.