Skip to main content
QUICK REVIEW

[논문 리뷰] Curvature-aided Incremental Aggregated Gradient Method

Hoi-To Wai, Wei Shi|arXiv (Cornell University)|2017. 10. 24.
Sparse and Compressive Sensing Techniques참고 문헌 12인용 수 3
한 줄 요약

이 논문은 유한 합 문제에서 수렴를 가속화하기 위해 증분 헤시안 정보를 활용하는 1차 최적화 알고리즘인 곡률 보조 증분 집합 기울기(CIAG) 방법을 제안한다. CIAG는 단일 반복당 ${\cal O}(d^2)$의 복잡도로 전체 기울기 방법과 유사한 선형 수렴 속도를 달성하며, 고차원 문제에서 반복 횟수와 계산 효율성 면에서 IAG와 IN을 모두 능가한다.

ABSTRACT

We propose a new algorithm for finite sum optimization which we call the curvature-aided incremental aggregated gradient (CIAG) method. Motivated by the problem of training a classifier for a d-dimensional problem, where the number of training data is $m$ and $m \gg d \gg 1$, the CIAG method seeks to accelerate incremental aggregated gradient (IAG) methods using aids from the curvature (or Hessian) information, while avoiding the evaluation of matrix inverses required by the incremental Newton (IN) method. Specifically, our idea is to exploit the incrementally aggregated Hessian matrix to trace the full gradient vector at every incremental step, therefore achieving an improved linear convergence rate over the state-of-the-art IAG methods. For strongly convex problems, the fast linear convergence rate requires the objective function to be close to quadratic, or the initial point to be close to optimal solution. Importantly, we show that running one iteration of the CIAG method yields the same improvement to the optimality gap as running one iteration of the full gradient method, while the complexity is $O(d^2)$ for CIAG and $O(md)$ for the full gradient. Overall, the CIAG method strikes a balance between the high computation complexity incremental Newton-type methods and the slow IAG method. Our numerical results support the theoretical findings and show that the CIAG method often converges with much fewer iterations than IAG, and requires much shorter running time than IN when the problem dimension is high.

연구 동기 및 목표

  • 대규모 유한 합 최적화에서 증분 집합 기울기(IAG) 방법의 느린 수렴 문제를 해결한다.
  • 헤시안 행렬의 역행렬 계산이 필요한 증분 뉴턴(IN) 방법의 높은 계산 비용을 극복한다.
  • IAG의 낮은 반복 복잡도와 전체 기울기 방법의 빠른 수렴 속도를 결합한 방법을 개발한다.
  • 특히 $m \gg d \gg 1$ 설정에서 최소한의 저장 및 계산 오버헤드로 선형 수렴을 달성한다.
  • 헤시안 역행렬이 악조건일 경우 IN이 수렴하지 못하는 고차원 문제에서 수치적 안정성과 확장성을 확보한다.

제안 방법

  • 각 단계에서 전체 기울기 벡터를 추적하기 위해 증분 헤시안 근사법을 도입한다.
  • 행렬 역행렬 계산 없이도 곡률(헤시안) 정보를 활용해 기울기 업데이트를 유도한다.
  • 성분 함수들에 대한 집합 헤시안의 누적 추정치를 유지하여 수렴을 향상시킨다.
  • 전체 기울기 반복의 수렴 속도와 渐近적으로 일치하는 스텝 사이즈 규칙을 적용한다.
  • 충분히 작은 스텝 사이즈로 강凸성 조건 하에서 전역 수렴을 보장한다.
  • 실제 적용에서 가속 수렴을 달성하기 위해 적응형 스텝 사이즈 전략을 제안한다.

실험 결과

연구 질문

  • RQ1헤시안 행렬의 역행렬 계산 없이도 곡률 정보를 사용해 증분 기울기 방법을 가속화할 수 있는가?
  • RQ2제안된 CIAG 방법이 전체 기울기 방법과 유사한 선형 수렴 속도를 달성하는가?
  • RQ3고차원 설정에서 CIAG는 IAG와 IN에 비해 수렴 속도와 계산 비용 면에서 어떻게 비교되는가?
  • RQ4IN이 악조건의 헤시안 역행렬 계산으로 인해 수렴하지 못할 경우에도 CIAG는 수치적 안정성과 수렴성을 유지할 수 있는가?
  • RQ5증분 최적화에서 수렴 속도와 반복 복잡도 사이의 상충 관계는 어떠한가?

주요 결과

  • CIAG는 ${\cal O}(d^2)$의 반복 복잡도로 $1 - 4Q/(Q+1)^2$의 선형 수렴 속도를 달성하며, 이는 전체 기울기 방법의 속도와 동일하다.
  • 이차형 목적 함수 또는 최적점 근처의 초기점에서는 CIAG 한 번의 반복이 전체 기울기 반복 한 번과 동일한 최적성 간격 향상 효과를 낸다.
  • 수치적 결과는 CIAG가 IAG보다 훨씬 적은 반복 수로 수렴하고, 고차원 문제에서 IN보다도 더 짧은 시간 내에 수렴함을 보여준다($d=501$, $m=2000$).
  • IN 방법은 고차원 케이스(예: $d=501$)에서 수렴하지 못하지만, CIAG는 수치적으로 안정적이고 효율적이다.
  • 실제 데이터셋(mushrooms, w8a, alpha)에서 CIAG는 IAG보다 적은 유효 패assing 수로 수렴하고, IN보다도 더 짧은 시간 내에 수렴하지만, IN은 반복 수가 더 빠르다.
  • alpha 데이터셋($d=500$, $m=500,000$)의 경우, CIAG는 7.6회의 유효 패assing과 463.08초가 소요되었고, IN은 2.3회의 패assing이지만 높은 헤시안 역행렬 비용으로 1130.7초가 소요되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.