Skip to main content
QUICK REVIEW

[논문 리뷰] History-Gradient Aided Batch Size Adaptation for Variance Reduced Algorithms

Kaiyi Ji, Zhe Wang|arXiv (Cornell University)|2019. 10. 21.
Stochastic Gradient Optimization Techniques참고 문헌 42인용 수 10
한 줄 요약

이 논문은 SVRG와 SPIDER와 같은 분산 감소 최적화 알고리즘을 위한 새로운 배치 크기 적응 기법을 제안한다. 이 기법은 과거의 스위치 기울기 평균 크기에 기반해 배치 크기를 동적으로 증가시키며, 백트래킹 선색 검색이 필요 없도록 한다. 이 방법은 비볼록 최적화와 강화 학습 모두에서 수렴 복잡도 향상과 더 빠른 실용적 성능을 달성하며, 이론적 보장과 경험적 검증을 통해 입증된다.

ABSTRACT

Variance-reduced algorithms, although achieve great theoretical performance, can run slowly in practice due to the periodic gradient estimation with a large batch of data. Batch-size adaptation thus arises as a promising approach to accelerate such algorithms. However, existing schemes either apply prescribed batch-size adaption rule or exploit the information along optimization path via additional backtracking and condition verification steps. In this paper, we propose a novel scheme, which eliminates backtracking line search but still exploits the information along optimization path by adapting the batch size via history stochastic gradients. We further theoretically show that such a scheme substantially reduces the overall complexity for popular variance-reduced algorithms SVRG and SARAH/SPIDER for both conventional nonconvex optimization and reinforcement learning problems. To this end, we develop a new convergence analysis framework to handle the dependence of the batch size on history stochastic gradients. Extensive experiments validate the effectiveness of the proposed batch-size adaptation scheme.

연구 동기 및 목표

  • 주기적인 대규모 배치 기울기 추정으로 인한 분산 감소 알고리즘의 느린 실용적 수렴 문제를 해결하기 위해.
  • 기존의 배치 크기 적응 기법에서 백트래킹 선색 검색의 계산 오버헤드를 제거하기 위해.
  • 역사 기울기 정보를 활용한 이론적으로 타당하고 구현이 쉬운 배치 크기 적응 방법을 개발하기 위해.
  • 비볼록 및 강화 학습 환경에서 SVRG, SPIDER 및 그 정책 기울기 변형의 전체 복잡도와 수렴 속도를 향상시키기 위해.

제안 방법

  • 각 외부 루프에서 이전 에포크의 스위치 기울기 평균 노름에 반비례하게 배치 크기를 적응한다.
  • 이전 반복에서의 평균 기울기 노름을 현재 기울기 크기의 대체 지표로 사용하여, 백트래킹 없이 배치 크기를 설정한다.
  • 비볼록 최적화를 위한 AbaSVRG와 AbaSPIDER, 강화 학습을 위한 AbaSVRPG와 AbaSPIDER-PG를 도입한다.
  • 과거 기울기 의존성에 기반한 배치 크기의 변화를 고려하는 새로운 수렴 분석 프레임워크를 개발한다. 이는 목적 함수 값 변화에 대한 더 날카운 경계를 가능하게 한다.
  • 역사 기울기 노름을 사용하여 각 에포크 동안 기대 함수 값 감소를 경계함으로써 수렴 보장을 수립한다.
  • 기존의 에포크 기반 또는 반복 기반 내림막 분석과 다름없는 새로운 분석 기법을 활용하여, 더 유연한 파rameter 선택과 향상된 복잡도 경계를 가능하게 한다.

실험 결과

연구 질문

  • RQ1역사 기울기를 기반으로 한 배치 크기 적응이 백트래킹 없이 분산 감소 알고리즘의 수렴 속도를 향상시킬 수 있는가?
  • RQ2역사 기울기 기반 배치 크기 적응은 비볼록 최적화에서 전체 반복 수와 함수 평가 복잡도에 어떤 영향을 미치는가?
  • RQ3이 기법은 이론적 수렴 보장을 갖는 강화 학습의 정책 기울기 방법으로 확장될 수 있는가?
  • RQ4기본 SVRG와 SPIDER에 비해 제안된 적응적 배치 크기 알고리즘의 이론적 복잡도 경계는 무엇인가?
  • RQ5새로운 수렴 분석 프레임워크는 과거 스위치 기울기에 의존하는 배치 크기의 의존성을 어떻게 다루는가?

주요 결과

  • 제안된 AbaSVRG와 AbaSPIDER 알고리즘은 역사 기울기를 기반으로 한 배치 크기 적응을 통해 비볼록 최적화에서 개선된 수렴 복잡도를 달성한다.
  • AbaSVRPG와 AbaSPIDER-PG 알고리즘은 기준 분산 감소 정책 기울기 방법에 비해 강화 학습 과제에서 더 빠른 수렴과 향상된 성능을 보인다.
  • 이론적 분석 결과, 기대 기울기 노름이 $\mathcal{O}(1/\epsilon^2 \wedge n/\epsilon)$개의 스위치 1차 오рак루(SFO) 호출 후 $\epsilon$ 이하로 경계됨을 보여준다.
  • 백트래킹 선색 검색을 피하면서도 수렴 보장을 유지함으로써 알고리즘 복잡도를 감소시킨다.
  • 경험적 결과는 적응적 배치 크기 기법이 최적화 및 강화 학습 환경 모두에서 학습을 가속화하고 안정성을 향상시킴을 확인한다.
  • 새로운 수렴 분석 프레임워크는 기존의 SVRG 유형 알고리즘에 비해 더 날카운 경계와 더 유연한 파rameter 튜닝을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.