Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive Importance Sampling for Finite-Sum Optimization and Sampling with Decreasing Step-Sizes

Ayoub El Hanchi, David A. Stephens|arXiv (Cornell University)|2021. 03. 23.
Stochastic Gradient Optimization Techniques인용 수 4
한 줄 요약

이 논문은 감소하는 스텝 사이즈를 가진 유한합 최적화 및 샘플링을 위한 적응형 중요도 샘플링 알고리즘인 Avare를 제안한다. 온라인 학습과 분산 감소 기법을 활용하여, SGD와 SGLD에 대해 각각 $Ø(T^{2/3})$ 및 $Ø(T^{5/6})$의 동적 리그레트를 달성하며, 분산이 지배하는 후반 최적화 단계에서 수렴성을 크게 향상시킨다.

ABSTRACT

Reducing the variance of the gradient estimator is known to improve the convergence rate of stochastic gradient-based optimization and sampling algorithms. One way of achieving variance reduction is to design importance sampling strategies. Recently, the problem of designing such schemes was formulated as an online learning problem with bandit feedback, and algorithms with sub-linear static regret were designed. In this work, we build on this framework and propose Avare, a simple and efficient algorithm for adaptive importance sampling for finite-sum optimization and sampling with decreasing step-sizes. Under standard technical conditions, we show that Avare achieves $\mathcal{O}(T^{2/3})$ and $\mathcal{O}(T^{5/6})$ dynamic regret for SGD and SGLD respectively when run with $\mathcal{O}(1/t)$ step sizes. We achieve this dynamic regret bound by leveraging our knowledge of the dynamics defined by the algorithm, and combining ideas from online learning and variance-reduced stochastic optimization. We validate empirically the performance of our algorithm and identify settings in which it leads to significant improvements.

연구 동기 및 목표

  • 대규모 유한합 문제에서의 확률적 그래디언트 추정기의 분산 문제를 해결하기 위해.
  • 감소하는 스텝 사이즈를 가진 최적화 과정에서 동적으로 분산을 최소화하는 적응형 중요도 샘플링 전략을 개발하기 위해.
  • 기본 기술 조건 하에서 SGD와 SGLD에 대해 하한선을 초과하는 동적 리그레트 경계를 달성하기 위해.
  • 실제 머신러닝 환경에서 제안된 방법의 성능 향상을 경험적으로 검증하기 위해.
  • 편미분 샘플링을 유지하면서 미니배치 샘플링으로의 프레임워크 확장을 위해.

제안 방법

  • Avare는 부분적 그래디언트 노름 관측을 이용한 밴딧 피드백을 가진 온라인 학습 문제로 중요도 샘플링을 공식화한다.
  • 그것은 그래디언트 추정기의 공분산 행렬의 트레이스를 최소화하기 위해 동적으로 샘플링 분포 $p^t$를 업데이트한다.
  • 알고리즘은 샘플링 없이 교체하는 것과 중요도 샘플링의 이점을 결합하면서도 비편향성을 유지하는 새로운 미니배치 추정기를 사용한다.
  • 감소하는 스텝 사이즈와 같은 알고리즘의 역학적 지식을 활용하여 리그레트 경계를 유도한다.
  • 일정한 스텝 사이즈 적응을 위해 수정된 에프스론 수열을 통합하여 안정적인 성능을 보장한다.
  • 리그레트 분석은 온라인 학습과 분산 감소 확률적 최적화 도구를 결합하여 동적 리그레트 경계를 도출한다.

실험 결과

연구 질문

  • RQ1감소하는 스텝 사이즈를 가진 SGD와 SGLD에 대해 적응형 중요도 샘플링이 하한선을 초과하는 동적 리그레트를 달성할 수 있는가?
  • RQ2비정적 환경에서 적응형 중요도 샘플링의 동적 리그레트는 정적 리그레트와 비교해 어떻게 다를까?
  • RQ3감소하는 스텝 사이즈는 확률적 최적화에서 분산 감소의 효과성에 어떤 영향을 미치는가?
  • RQ4샘플링 없이 교체하는 것과 중요도 샘플링의 이점을 결합하면서도 비편향성을 유지할 수 있는 미니배치 추정기를 설계할 수 있는가?
  • RQ5실제 데이터셋에서 Avare는 균일 샘플링 및 기타 중요도 샘플링 전략과 비교해 어떻게 성능을 발휘하는가?

주요 결과

  • 기본 기술 조건 하에서 $Ø(1/t)$ 스텝 사이즈를 사용할 경우, Avare는 SGD에 대해 $Ø(T^{2/3})$의 동적 리그레트를 달성한다.
  • 동일한 스텝 사이즈 제약 하에서 SGLD에 대해 Avare는 $Ø(T^{5/6})$의 동적 리그레트를 달성한다.
  • 알고리즘은 그래디언트 추정기의 분산을 크게 감소시켜 후반 최적화 단계에서 더 빠른 수렴을 이끌어낸다.
  • MNIST, IJCNN1, CIFAR10에서의 경험적 결과는 Avare가 균일 샘플링 및 기타 기준보다 뛰어난 성능을 보이며, 특히 분산 지배 영역에서 두각을 나타낸다.
  • 수정된 에프스론 수열은 일정한 스텝 사이즈에서도 안정적인 성능을 가능하게 하여 감소하는 스텝 사이즈 가정을 초월한 강건성을 시사한다.
  • 제안된 미니배치 추정기는 샘플링 없이 교체하는 것과 중요도 샘플링의 이점을 모두 유지하면서도 비편향성을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.