[논문 리뷰] Variance reduction for Riemannian non-convex optimization with batch size adaptation
이 논문은 분산 감소된 리만 비볼록 최적화를 위한 적응형 배치 크기 전략을 제안하며, R-SVRG 및 R-SRG/R-SPIDER 방법을 향상시킨다. 동적으로 배치 크기를 조정하여 분산을 더 효율적으로 줄임으로써, 이전 방법보다 낮은 총 반복 복잡도를 달성하며, 수렴 속도가 향상되고 분석이 단순해지며, 특히 유한합 및 온라인 설정에서 경사도 우세 함수에 대해 유리하다.
Variance reduction techniques are popular in accelerating gradient descent and stochastic gradient descent for optimization problems defined on both Euclidean space and Riemannian manifold. In this paper, we further improve on existing variance reduction methods for non-convex Riemannian optimization, including R-SVRG and R-SRG/R-SPIDER with batch size adaptation. We show that this strategy can achieve lower total complexities for optimizing both general non-convex and gradient dominated functions under both finite-sum and online settings. As a result, we also provide simpler convergence analysis for R-SVRG and improve complexity bounds for R-SRG under finite-sum setting. Specifically, we prove that R-SRG achieves the same near-optimal complexity as R-SPIDER without requiring a small step size. Empirical experiments on a variety of tasks demonstrate effectiveness of proposed adaptive batch size scheme.
연구 동기 및 목표
- 유한합 및 온라인 설정에서 R-SVRG 및 R-SRG/R-SPIDER의 총 반복 복잡도를 낮추기 위해 동적으로 배치 크기를 조정함으로써 수렴 복잡도를 향상시키는 것.
- 유한합 및 온라인 설정에서 R-SVRG 및 R-SRG/R-SPIDER의 총 반복 복잡도를 감소시키는 것.
- R-SVRG의 수렴 분석을 단순화하고, 작은 단계 크기 조건 없이도 R-SRG의 복잡도 한계를 향상시키는 것.
- 적응형 배치 크기 전략이 다양한 리만 최적화 작업에서 성능 향상을 이끌어내는지 확인하는 것.
- 경사도 우세 함수에 대해 near-optimal 복잡도를 달성할 수 있는 이론적 보장을 제공하는 것.
제안 방법
- 수렴 분산을 줄이기 위해 시간이 지남에 따라 배치 크기를 증가시키는 배치 크기 적응 메커니즘을 도입한다.
- 적응형 배치 크기를 R-SVRG 및 R-SRG/R-SPIDER에 적용하여, 각 반복에서 변화하는 배치 크기를 사용하도록 업데이트 규칙을 수정한다.
- 벡터 운반을 사용하여 다양체에서 정확성을 유지하면서 분산을 줄이는 재귀적 경사도 추정기를 사용한다.
- 유한합 및 온라인 설정 모두에서 수렴 한계를 유도하여, 고정된 배치 크기 방법보다 복잡도가 향상됨을 보여준다.
- 기대 경사도 노름을 유한하게 유지하기 위해 균일한 출력 샘플링 전략을 사용하여 수렴을 보장한다.
- 리아푸노프 함수와 재귀적 분산 감소 기법을 사용하여 이론적 복잡도 한계를 수립한다.
실험 결과
연구 질문
- RQ1배치 크기 적응 전략이 분산 감소된 리만 비볼록 최적화 방법의 총 복잡도를 향상시킬 수 있는가?
- RQ2적응형 배치 크기 전략이 유한합 및 온라인 리만 비볼록 최적화에서 더 빠른 수렴을 이끌어낼 수 있는가?
- RQ3R-SVRG의 수렴 분석은 적응형 배치 크기 전략 하에서 단순화될 수 있으며, 복잡도 한계는 유지되거나 향상될 수 있는가?
- RQ4제안된 방법은 리만 다양체에서 경사도 우세 함수에 대해 near-optimal 복잡도를 달성하는가?
- RQ5적응형 배치 크기 전략은 다양한 리만 최적화 작업에서 고정된 배치 크기 기반 방법과 비교해 실제로 어떻게 성능을 냈는가?
주요 결과
- 제안된 적응형 배치 크기 전략은 유한합 및 온라인 설정 모두에서 기존의 R-SVRG 및 R-SRG 방법보다 낮은 총 복잡도를 달성한다.
- 적응형 배치 크기 전략을 적용한 R-SRG는 작은 단계 크기 조건 없이도 R-SPIDER와 동일한 near-optimal 복잡도를 달성한다.
- R-SVRG의 수렴 분석이 단순화되었으며, 적응형 배치 크기 전략 하에서 복잡도 한계가 향상되었다.
- PCA, 저랭크 행렬 복원, 리만 K-means에서의 실험 결과는 다양한 다양체에서 적응형 배치 크기 전략의 효과를 확인한다.
- 초기 학습 단계에서 경사도 분산을 더 효율적으로 줄이며, 수렴에 가까워질수록 더 높은 배치 크기로 적응하여 안정성과 속도를 향상시킨다.
- 총 IFO 복잡도는 고정된 배치 크기의 R-SPIDER 대비 $1/\theta$ 배 감소하였으며, $\Xi = \mathcal{O}(\frac{\Theta G}{\epsilon})$ 가 복잡도 스케일링을 주도한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.