Skip to main content
QUICK REVIEW

[논문 리뷰] Momentum with Variance Reduction for Nonconvex Composition Optimization

Ziyi Chen, Yi Zhou|arXiv (Cornell University)|2020. 05. 15.
Stochastic Gradient Optimization Techniques참고 문헌 30인용 수 4
한 줄 요약

이 논문은 SPIDER 기반 분산 감소 기법을 사용한 비볼록 조합 최적화를 위한 새로운 동적 모멘텀 알고리즘을 제안한다. 유한합 및 온라인 설정 모두에서 거의 최적의 샘플 복잡도를 달성하며, 기존 카티우샤 스타일의 방법들에 비해 프록시맵핑 평가 횟수를 줄였고, 기울기 지배 조건 하에서 선형 수렴를 확립하여 기존 방법들보다 수렴 속도를 크게 향상시킨다.

ABSTRACT

Composition optimization is widely-applied in nonconvex machine learning. Various advanced stochastic algorithms that adopt momentum and variance reduction techniques have been developed for composition optimization. However, these algorithms do not fully exploit both techniques to accelerate the convergence and are lack of convergence guarantee in nonconvex optimization. This paper complements the existing literature by developing various momentum schemes with SPIDER-based variance reduction for non-convex composition optimization. In particular, our momentum design requires less number of proximal mapping evaluations per-iteration than that required by the existing Katyusha momentum. Furthermore, our algorithm achieves near-optimal sample complexity results in both non-convex finite-sum and online composition optimization and achieves a linear convergence rate under the gradient dominant condition. Numerical experiments demonstrate that our algorithm converges significantly faster than existing algorithms in nonconvex composition optimization.

연구 동기 및 목표

  • 비볼록 조합 최적화에서 동적 모멘텀 기반 분산 감소에 대한 수렴 보장을 제공하지 못하는 문제를 해결한다.
  • 기존의 카티우샤 스타일의 모멘텀 방법들에 비해 반복마다 프록시맵핑 평가 횟수를 줄인다.
  • 비볼록 유한합 및 온라인 조합 최적화에서 거의 최적의 샘플 복잡도를 달성한다.
  • 모멘텀과 분산 감소를 적용한 온라인 비볼록 조합 최적화 문제에 대해 증명 가능한 수렴 보장을 제공한다.
  • 비볼록 설정에서 이론적 최적성을 유지하면서 실용적 수렴 속도를 가속화한다.

제안 방법

  • 비볼록 조합 문제에 적합한 새로운 모멘텀 스킴을 SPIDER 기반 분산 감소와 통합하여 제안한다.
  • 반복마다 단 한 번의 프록시맵핑 평가만 필요로 하는 새로운 모멘텀 업데이트를 설계하여 계산 오버헤드를 감소시킨다.
  • 두 수준의 샘플링 전략을 활용: 주기적으로 전체 기울기 계산, 나머지 경우는 확률적 기울기 사용하며, SPIDER의 저분산 기울기 추정치를 활용한다.
  • 수렴 속도와 안정성의 균형을 맞추기 위한 하이브리드 하이퍼파ram터 선택 규칙을 도입하여 이론적 보장을 보장한다.
  • 적응형 단계 크기와 기울기 추적을 통한 재귀적 모멘텀 업데이트를 사용하여 분산을 줄이고 수렴 속도를 가속화한다.
  • 텔레스코핑 급수와 리아푸노프 분석을 사용하여 비볼록 및 기울기 지배 조건 하에서의 수렴을 이론적으로 유도한다.

실험 결과

연구 질문

  • RQ1SPIDER 기반 분산 감소를 통합한 모멘텀 스킴을 비볼록 조합 최적화에 적용하여 증명 가능한 수렴 보장을 확보할 수 있는가?
  • RQ2기존의 카티우샤 스타일의 모멘텀 방법들에 비해 반복마다 프록시맵핑 평가 횟수를 줄일 수 있는가?
  • RQ3제안된 알고리즘이 유한합 및 온라인 비볼록 조합 최적화 모두에서 거의 최적의 샘플 복잡도를 달성하는가?
  • RQ4기울기 지배 조건 하에서 알고리즘이 선형 수렴 속도를 달성하는가?
  • RQ5기존 최첨단 방법들에 비해 알고리즘이 실용적으로 상당한 수렴 가속을 보이는가?

주요 결과

  • 제안된 알고리즘은 유한합 조합 최적화 문제에 대해 거의 최적의 샘플 복잡도 O(√max(N,n)ε⁻² + N + n)를 달성한다.
  • 온라인 조합 최적화의 경우 샘플 복잡도는 O(ε⁻³)이며, 로그 인자 수준까지는 이론적 하한선과 일치한다.
  • 알고리즘은 반복마다 단 한 번의 프록시맵핑 평가만 필요로 하여 기존 카티우샤 기반 방법의 두 번의 평가에 비해 계산 비용을 감소시킨다.
  • 기울기 지배 조건 하에서 알고리즘은 선형 수렴 속도를 달성하여 빠른 실용적 수렴을 보여준다.
  • 수치 실험을 통해 기존 알고리즘들에 비해 비볼록 조합 최적화 설정에서 상당히 더 빠르게 수렴하는 것으로 확인된다.
  • 이론적 분석을 통해 기대값 기반 수렴을 확립하고, 부적합도 갭과 기울기 노름에 대한 명시적 경계를 도출한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.