Skip to main content
QUICK REVIEW

[논문 리뷰] Proximal Splitting Meets Variance Reduction

Fabián Pedregosa, Kilian Fatras|arXiv (Cornell University)|2018. 06. 19.
Stochastic Gradient Optimization Techniques인용 수 6
한 줄 요약

이 논문은 복수의 비미분 항을 효율적으로 처리하기 위해 한 번의 반복마다 단 한 번의 프록시멀 연산자 평가만을 요구함으로써, 전체 기울기 방법과 동일한 渐진 수렴 속도를 달성하면서도 일정한 스텝 사이즈와 낮은 메모리 비용을 유지하는 분산 감소 프록시멀 스플리팅 방법인 Vr-Tos를 제안한다. 이는 과도한 그룹 라소나 총 변동성과 같은 복잡한 페널티를 가진 대규모 문제에 특히 유리하다.

ABSTRACT

Despite the rise to fame of incremental variance-reduced methods in recent years, their use in nonsmooth optimization is still limited to few simple cases. This is due to the fact that existing methods require to evaluate the proximity operator for the nonsmooth terms, which can be a costly operation for complex penalties. In this work we introduce two variance-reduced incremental methods based on SAGA and SVRG that can efficiently take into account complex penalties which can be expressed as a sum of proximal terms. This includes penalties such as total variation, group lasso with overlap and trend filtering, to name a few. Furthermore, we also develop sparse variants of the proposed algorithms which can take advantage of sparsity in the input data. Like other incremental methods, it only requires to evaluate the gradient of a single sample per iteration, and so is ideally suited for large scale applications. We provide a convergence rate analysis for the proposed methods and show that they converge with a fixed step-size, achieving in some cases the same asymptotic rate as their full gradient variants. Empirical benchmarks on 3 different datasets illustrate the practical advantages of the proposed methods.

연구 동기 및 목표

  • 총 변동성이나 오버랩핑 그룹 라소와 같은 복잡한 비미분 페널티를 처리하는 데 기존의 스위치드 분산 감소 방법이 효율적이지 못한 문제를 해결하기 위해.
  • 프록시멀 스플리팅 방법과 분산 감소 기법을 융합하여, 복수의 비미분 항을 가진 대규모 최적화를 효율적으로 수행할 수 있도록 하기 위해.
  • 이전 방법들이 매 단계마다 프록시멀 연산자를 평가해야 했던 데 반해, 이 방법은 한 번의 반복마다 단 한 번의 프록시멀 연산자 평가만으로도 계산 비용을 줄이기 위해.
  • 고정된 스텝 사이즈를 유지하면서도 전체 기울기 방법과 동일한 渐진 수렴 속도를 확보하기 위해.
  • 선형적으로 파arameter화된 손실 함수에 대해 희소 데이터 구조와 압축된 메모리 저장 방식을 지원하기 위해.

제안 방법

  • Vr-Tos는 삼중 연산자 스플리팅 프레임워크와 스위치드 분산 감소를 결합하며, Saga에서 영감을 얻은 메모리 효율적인 기울기 추정기를 사용한다.
  • 과거 기울기의 표를 유지하고 이를 점진적으로 업데이트함으로써, 선형적으로 파arameter화된 손실에 대해 메모리 비용을 O(n) 스칼라로 줄인다.
  • 비미분 항 각각의 프록시멀 연산자는 반복마다 단 한 번만 평가되며, 이는 복잡한 페널티에 대한 확장성 향상에 기여한다.
  • 고정된 스텝 사이즈를 사용하며, 전체 기울기 변형과 동일한 渐진 수렴 속도를 보장한다.
  • 희소성 구조를 활용하는 희소 버전을 도입하여, 전체 기울기 벡터 대신 스칼라 계수만 저장함으로써 메모리 사용량을 줄였다.
  • 메모리 항목과 쌍대 변수의 초기화가 유연하며, 초기 반복에서 SGD 유사 행동을 유도하기 위해 0에서 시작하는 것이 권장된다.

실험 결과

연구 질문

  • RQ1분산 감소 방법을 프록시멀 스플리팅과 효과적으로 융합하여, 대규모 최적화 문제에서 복수의 비미분 항을 효율적으로 처리할 수 있는가?
  • RQ2고정된 스텝 사이즈를 유지하면서도 매 반복마다 프록시멀 연산자를 단 한 번만 평가함으로써 전체 기울기 방법과 동일한 渐진 수렴 속도를 달성할 수 있는가?
  • RQ3선형적으로 파arameter화된 문제에서 기울기 표현의 희소성을 활용함으로써 메모리 비용을 크게 줄일 수 있는가?
  • RQ4복잡한 페널티를 가진 대규모 데이터셋에서 기존 방법들인 Prox-SVRG, Saga, STOS와 비교해 실제로 Vr-Tos는 어떤 성능을 보이는가?
  • RQ5수렴 보장을 유지하면서도 계산 효율성에 손상 없이 임의의 수의 비미분 항에 일반화할 수 있는가?

주요 결과

  • Vr-Tos는 일정한 스텝 사이즈를 유지함에도 불구하고 전체 기울기 방법과 동일한 渐진 수렴 속도를 달성한다.
  • 비미분 항의 수에 관계없이 반복마다 프록시멀 연산자를 단 한 번만 평가함으로써, 복잡한 페널티의 효율적 처리가 가능하다.
  • 네 개의 대규모 데이터셋에서 Vr-Tos는 Prox-SVRG, Saga, STOS와 같은 기존 방법들보다 수렴 속도와 계산 효율성 측면에서 뛰어난 성능을 보였다.
  • Vr-Tos의 희소 버전은 선형적으로 파arameter화된 손실에 대해 메모리 사용량을 O(n) 스칼라로 줄여 고차원 문제에 대한 확장성을 보장한다.
  • KDD12 데이터셋(1억 4900만 개의 샘플과 5400만 개의 특성 포함)을 포함한 다양한 데이터셋에서 안정적인 성능을 유지한다.
  • 실험 결과에 따르면, 유리한 초기화와 기울기 추정 방식 덕분에 Vr-Tos는 SGD-Tos 및 기타 분산 감소 변형보다 초기 반복에서 더 빠르게 수렴하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.