Skip to main content
QUICK REVIEW

[논문 리뷰] Apollo: An Adaptive Parameter-wise Diagonal Quasi-Newton Method for Nonconvex Stochastic Optimization

Xuezhe Ma|arXiv (Cornell University)|2020. 09. 28.
Stochastic Gradient Optimization Techniques인용 수 14
한 줄 요약

Apollo는 비볼록 스 tochastic 최적화를 위한 파라미터별 대각선 쿼asi-뉴턴 방법으로, 헤시안을 대각행렬을 사용해 적응적으로 근사하며, 절대값을 보정하여 양의 정부호성을 보장한다. 선형 시간 및 메모리 복잡도를 확보하여, 시각 및 언어 작업 전반에서 SGD 및 Adam 변종보다 수렴 속도와 일반화 성능에서 뛰어나다.

ABSTRACT

In this paper, we introduce Apollo, a quasi-Newton method for nonconvex stochastic optimization, which dynamically incorporates the curvature of the loss function by approximating the Hessian via a diagonal matrix. Importantly, the update and storage of the diagonal approximation of Hessian is as efficient as adaptive first-order optimization methods with linear complexity for both time and memory. To handle nonconvexity, we replace the Hessian with its rectified absolute value, which is guaranteed to be positive-definite. Experiments on three tasks of vision and language show that Apollo achieves significant improvements over other stochastic optimization methods, including SGD and variants of Adam, in term of both convergence speed and generalization performance. The implementation of the algorithm is available at https://github.com/XuezheMax/apollo.

연구 동기 및 목표

  • Adam과 같은 1차 미분 적응 방법의 한계를 해결하기 위해, 낮은 국소 최적점으로 수렴하거나 일반화 성능이 열 劣하는 문제를 해결한다.
  • 딥러닝과 같은 고차원, 비볼록, 스 tochastic 환경에서 전통적인 쿼asi-뉴턴 방법의 비효율성을 극복한다.
  • 높은 계산 및 메모리 비용 없이도 곡률 정보를 효율적으로 통합할 수 있는 확장 가능한 쿼asi-뉴턴 방법을 개발한다.
  • 헤시안 근사치를 절대값을 보정한 방식으로 수정하여 비볼록 환경에서도 안정성과 수렴성을 확보한다.

제안 방법

  • 기울기 차이를 기반으로 반복적으로 갱신되는 대각행렬을 사용해 헤시안을 근사하며, 파라미터별 약한 세컨드 조건을 만족시킨다.
  • 비볼록성에 대응하기 위해 대각 헤시안 근사치에 절대값을 보정하는 연산을 적용하여 양의 정부호성을 보장한다.
  • 초기 수렴 안정성을 향상시키기 위해 선형적으로 증가하는 학습률 스케줄을 적용한다.
  • 오직 대각 원소만 저장하고 점진적으로 갱신함으로써 선형 시간 및 메모리 복잡도를 유지한다.
  • 기울기 차이의 무한노름과 함께 보정 임계값을 결합함으로써 척도 불변 버전을 도입하여 추가 하이퍼파rameter가 필요 없도록 한다.
  • 파라미터별 기울기 클리핑을 자연스럽게 통합하여 학습의 강건성을 향상시킨다.

실험 결과

연구 질문

  • RQ1딥러닝에서 비볼록 스 tochastic 최적화에 대해 효율적이고 효과적인 대각선 쿼asi-뉴턴 방법을 만들 수 있는가?
  • RQ2대각 헤시안 근사치를 통해 곡률 정보를 통합할 경우, 1차 방법 대비 수렴 속도와 일반화 성능에 어떤 영향을 미치는가?
  • RQ3비볼록성에 강건하면서도 선형 복잡도를 유지할 수 있도록 헤시안 근사치를 개선할 수 있는가?
  • RQ4헤시안 근사치의 보정된 절대값이 실질적으로 학습 안정성과 일반화 성능을 향상시키는가?
  • RQ5추가 하이퍼파rameter 없이도 방법을 척도 불변으로 만들 수 있는가?

주요 결과

  • CIFAR-10에서 Apollo는 SGD보다 1.42배 빠른 학습 속도를 기록했으며, ImageNet에서는 1.49배 빠르게, ResNeXt-50에서는 1.62배 낮은 메모리 비용을 기록했다.
  • One Billion Words 언어 모델링 작업에서 Apollo는 테스트 손실 31.75 ± 0.10을 기록하여 표준 기울기 클리핑(31.94 ± 0.09)을 초월했다.
  • WMT-14 신경 기계 번역 작업에서 Apollo는 BLEU 점수 28.39 ± 0.11을 기록하여 표준 기울기 클리핑(28.34 ± 0.10)보다 略적으로 뛰어났다.
  • 소형 CNN 모델에서 Apollo는 SdLBFGS보다 수렴 속도가 더 빠르며, 반복당 10배 이상 더 빠르고 메모리 사용량도 현저히 적었다.
  • Apollo의 척도 불변 버전은 추가 하이퍼파rameter가 필요 없이도 성능을 유지했다.
  • 2차 미분 방법인 AdaHessian는 상당히 높은 비용을 수반했으며, CIFAR-10과 ImageNet에서 각각 5.76배, 11.78배 느린 속도를 보여, Apollo의 효율성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.