Skip to main content
QUICK REVIEW

[논문 리뷰] Newton-LESS: Sparsification without Trade-offs for the Sketched Newton Update

Michał Dereziński, Jonathan Lacotte|arXiv (Cornell University)|2021. 07. 15.
Sparse and Compressive Sensing Techniques인용 수 7
한 줄 요약

Newton-LESS는 희소화된 스케칭 방법을 도입하여 밀도가 높은 가우시안 임베딩의 수렴 성질을 유지하면서도 계산 비용을 크게 감소시킨다. 등급 스코어 희소화(Leverage Score Sparsified, LESS) 임베딩과 균일한 무작위 희소화를 활용함으로써 문제에 종속되지 않는 국소 수렴 속도를 거의 가우시안 스케칭과 동일하게 달성하며, 성능이나 정확도에 희생 없이 반복적 최소 제곱법 해법기의 새로운 최고 성능을 확립한다.

ABSTRACT

In second-order optimization, a potential bottleneck can be computing the Hessian matrix of the optimized function at every iteration. Randomized sketching has emerged as a powerful technique for constructing estimates of the Hessian which can be used to perform approximate Newton steps. This involves multiplication by a random sketching matrix, which introduces a trade-off between the computational cost of sketching and the convergence rate of the optimization algorithm. A theoretically desirable but practically much too expensive choice is to use a dense Gaussian sketching matrix, which produces unbiased estimates of the exact Newton step and which offers strong problem-independent convergence guarantees. We show that the Gaussian sketching matrix can be drastically sparsified, significantly reducing the computational cost of sketching, without substantially affecting its convergence properties. This approach, called Newton-LESS, is based on a recently introduced sketching technique: LEverage Score Sparsified (LESS) embeddings. We prove that Newton-LESS enjoys nearly the same problem-independent local convergence rate as Gaussian embeddings, not just up to constant factors but even down to lower order terms, for a large class of optimization tasks. In particular, this leads to a new state-of-the-art convergence result for an iterative least squares solver. Finally, we extend LESS embeddings to include uniformly sparsified random sign matrices which can be implemented efficiently and which perform well in numerical experiments.

연구 동기 및 목표

  • 대규모 문제에서 헤시안 행렬 계산으로 인한 이차 최적화의 계산 병목 현상을 제거하기 위해.
  • 랜덤화된 뉴턴 방법에서 스케칭 비용과 수렴 속도 사이의 상충 관계를 해결하기 위해.
  • 가우시안 임베딩의 강력한 수렴 보장을 유지하면서도 희소화를 통해 효율적인 계산을 가능하게 하는 스케칭 방법을 개발하기 위해.
  • 희소화된 스케칭이 성능 저하 없이 밀도가 높은 가우시안 스케칭의 수렴 행동을 그대로 재현할 수 있는지 확인하기 위해.
  • LESS 임베딩이 뉴턴형 해법기에서 밀도 있는 스케칭의 실용적 대안으로 이론적 및 실증적 검증을 제공하기 위해.

제안 방법

  • 뉴턴 단계에서 헤시안을 근사하기 위해 등급 스코어 희소화(Leverage Score Sparsified, LESS) 임베딩을 사용하는 랜덤화된 이차 최적화 방법인 Newton-LESS를 제안한다.
  • 각 행에 고정된 수의 비영원소를 가지는 스케칭 행렬을 사용하며, 이를 균일하게 무작위로 선택하고 분산을 유지하기 위해 재스케일링한다.
  • 각 행에 정확히 $ d $ 개의 비영원소가 포함된 가우시안 임베딩의 균일한 무작위 희소화를 사용한다. 비영원소는 $ \pm (n / (m s))^{1/2} $ 에서 균일하게 무작위로 선택된다.
  • 데이터 행렬 $ \mathbf{A}_f(\mathbf{x}) $ 에 스케칭을 적용함으로써 헤시안 계산 비용을 $ O(nd^2) $ 에서 $ O(md^2) $ 로 감소시키며, 여기서 $ m \ll n $ 이다.
  • 이론적 수렴 한계를 도출하여 Newton-LESS가 $ O(d_{\text{eff}}/m) $ 의 국소 수렴 속도를 달성함을 보이며, 이는 가우시안 임베딩과 동일하다.
  • 효율적인 구현과 뛰어난 실증 성능을 위해 LESS 임베딩을 균일하게 희소화된 무작위 부호 행렬로 확장한다.

실험 결과

연구 질문

  • RQ1가우시안 스케칭 행렬을 희소화함으로써 수렴 속도가 저하되지 않게 할 수 있는가?
  • RQ2행당 정확히 $ d $ 개의 비영원소만을 가지는 희소화된 스케칭 행렬이 가우시안 임베딩의 문제에 종속되지 않는 수렴 보장을 유지하는가?
  • RQ3가우시안 임베딩의 균일한 무작위 희소화가 밀도 있는 스케칭과 비슷한 수렴 속도를 제공할 수 있는가?
  • RQ4Newton-LESS의 이론적 수렴 속도는 무엇이며, Sub-Sampling 및 SRHT와 같은 기존 스케칭 방법과 비교해 볼 때 어떻게 되는가?
  • RQ5다양한 데이터셋에서 실질적으로 Newton-LESS는 벽시계 시간과 오차 감소 측면에서 어떻게 성능을 발휘하는가?

주요 결과

  • Newton-LESS는 $ O(d_{\text{eff}}/m) $ 의 국소 수렴 속도를 달성하며, 이는 상수 요소뿐 아니라 고차항까지도 가우시안 임베딩의 이론적 속도와 정확히 일치한다.
  • 모든 테스트 데이터셋에서(고일관성 합성 데이터, Musk, CIFAR-10, WESAD 포함) 가우시안 스케칭과 거의 동일한 수렴 행동을 유지한다.
  • 균일하게 희소화된 LESS 임베딩(LESS-uniform)은 행당 정확히 $ d $ 개의 비영원소만을 가지더라도 가우시안 임베딩과 수렴 면에서 거의 동일한 성능을 보인다.
  • 수치 실험 결과, 빠른 속도 향상이 확인되었다: LESS-uniform은 오차 감소 수준이 유사한 밀도 있는 가우시안 스케칭에 비해 벽시계 시간을 크게 단축시켰다.
  • 정규화된 최소 제곱법에서는 Newton-LESS가 $ d_{\text{eff}}/m $ 로 경계되는 수렴 속도를 달성함을 확인하여 이론적 예측를 확인하였으며, 수렴 속도에서 Sub-Sampling 및 등급 스코어 샘플링보다 뛰어난 성능을 보였다.
  • 낮은 계산 비용과 강력한 수렴 보장을 결합함으로써 Newton-LESS는 반복적 최소 제곱법 해법기의 새로운 최고 성능을 확립하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.