Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient online learning with kernels for adversarial large scale problems

Rémi Jézéquel, Pierre Gaillard|arXiv (Cornell University)|2019. 02. 26.
Advanced Bandit Algorithms Research참고 문헌 27인용 수 3
한 줄 요약

이 논문은 기저 함수를 통한 커널 근사화를 사용하여 대규모의 악성 데이터 세트에 대해 near-optimal regret을 달성하는 효율적인 온라인 커널 학습 알고리즘을 제안한다. 가우시안 커널의 경우, 타일러 전개를 통해 기저 함수를 사전 계산하여 $O((\log n)^{d+1})$의 regret을 달성하며, 라운드당 복잡도는 $O((\log n)^{2d})$로, $n \gg e^d$일 때 적합하다. 일반적인 저효율 차원 커널의 경우, 데이터에 적응하는 니스트롬 샘플링을 사용하여 계산 효율성을 유지하면서 이전의 온라인 커널 방법을 향상시킨다.

ABSTRACT

We are interested in a framework of online learning with kernels for low-dimensional but large-scale and potentially adversarial datasets. We study the computational and theoretical performance of online variations of kernel Ridge regression. Despite its simplicity, the algorithm we study is the first to achieve the optimal regret for a wide range of kernels with a per-round complexity of order $n^α$ with $α< 2$. The algorithm we consider is based on approximating the kernel with the linear span of basis functions. Our contributions is two-fold: 1) For the Gaussian kernel, we propose to build the basis beforehand (independently of the data) through Taylor expansion. For $d$-dimensional inputs, we provide a (close to) optimal regret of order $O((\log n)^{d+1})$ with per-round time complexity and space complexity $O((\log n)^{2d})$. This makes the algorithm a suitable choice as soon as $n \gg e^d$ which is likely to happen in a scenario with small dimensional and large-scale dataset; 2) For general kernels with low effective dimension, the basis functions are updated sequentially in a data-adaptive fashion by sampling Nystr{ö}m points. In this case, our algorithm improves the computational trade-off known for online kernel regression.

연구 동기 및 목표

  • 표준 커널 방법이 라운드당 $O(n^2)$의 복잡도를 가지는 대규모의 악성 설정에서 온라인 커널 학습의 과제를 해결한다.
  • 악성 데이터 시퀀스에도 불구하고 온라인 커널 리지 회귀에서 최적 또는 near-optimal regret 보장을 달성한다.
  • 가우시안 커널과 일반 커널 모두에 대해 이론적 성능을 유지하면서 라운드당 $O(n^2)$ 이하의 계산 복잡도를 감소시킨다.
  • 일반적으로 $n \gg e^d$인 저차원이지만 대용량 데이터 세트에 적용 가능한 확장 가능한 프레임워크를 개발한다.
  • 가우시안 커널에 대한 사전 계산된 기저 함수와 일반 커널에 대한 적응형 니스트롬 샘플링을 통합하는 통합적 접근을 제공한다.

제안 방법

  • 가우시안 커널의 경우, 커널 함수의 타일러 전개를 사용하여 기저 함수를 사전에 구성하여 효율적인 온라인 업데이트를 가능하게 한다.
  • 사전 계산된 기저 함수의 선형 스펜을 통한 커널 근사화를 사용하여 온라인 학습 문제의 차원을 감소시킨다.
  • 복잡도를 감소시키면서도 regret 한계를 유지하기 위해 수정된 커널화된 예측 규칙을 사용한 지수적 경사 알고리즘을 적용한다.
  • 저효율 차원을 가지는 일반 커널의 경우, 순차적 니스트롬 샘플링을 사용하여 랜드마크 점을 동적으로 선택하고 커널 행렬의 저랭크 근사화를 유지한다.
  • Cholesky 업데이트(cholup)를 사용한 재귀적 업데이트 메커니즘을 유지하여 실시간으로 역행렬과 예측 가중치를 효율적으로 계산한다.
  • 니스트롬 투영을 통한 복잡도 감소를 유지하면서도 regret 보장을 유지하는 수정된 커널-AWV 알고리즘(PKAWV)을 도입한다.

실험 결과

연구 질문

  • RQ1대규모 데이터 세트에서 라운드당 복잡도가 $O(n^2)$ 이하인 온라인 커널 리지 회귀에서 near-optimal regret을 달성할 수 있는가?
  • RQ2가우시안 커널에 대해 사전에 기저 함수를 계산할 수 있는가? 이 경우 알고리즘이 최적의 regret과 비제곱 시간 복잡도를 유지할 수 있는가?
  • RQ3일반 커널의 경우 온라인 방식으로 니스트롬 점을 적응적으로 선택하여 저비용의 계산 비용과 강력한 regret 성능을 유지할 수 있는가?
  • RQ4이론적 regret 보장에 손상을 주지 않고 온라인 커널 회귀의 계산 트레이드오프를 향상시킬 수 있는가?
  • RQ5악성 데이터가 존재할 경우 데이터에 적응하는 니스트롬 샘플링이 이전의 근사화보다 더 나은 regret 한계를 제공하는가?

주요 결과

  • 가우시안 커널의 경우, 제안된 방법은 $O((\log n)^{d+1})$의 regret 한계를 달성하며, 이는 이 커널 유형에 대해 거의 최적이다.
  • 라운드당 시간 및 공간 복잡도는 $O((\log n)^{2d})$로, 표준 커널 방법의 $O(n^2)$ 복잡도보다 크게 향상된다.
  • 일반적으로 저차원 대규모 학습 시나리오에서 $n \gg e^d$일 때도 알고리즘이 효율성을 유지한다.
  • 저효율 차원을 가지는 일반 커널의 경우, 데이터에 적응하는 니스트롬 접근법은 복잡도를 감소시키면서도 $\lambda \|f\|^2 + B^2 d_{\text{eff}}(\lambda)$ 형태의 regret 한계를 유지한다. 이는 최적 속도에 해당한다.
  • 이전의 니스트롬 기반 근사화에서 보이는 $m$의 곱셈 계수와 $C$에 대한 의존성 없이, 더 강력한 regret 보장을 제공한다.
  • 복잡도 한계가 $n^\alpha$ 형태일 때 $\alpha < 2$인 다양한 커널에 대해 최적의 regret을 달성한다. 이는 이러한 성능을 달성하는 최초의 방법이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.