[논문 리뷰] Backtracking Gradient Descent allowing unbounded learning rates
이 논문은 학습률이 특정 함수 $ h $ 에 대한 감쇠 조건을 만족할 경우 무한히 증가할 수 있도록 허용하면서도 여전히 임계점으로의 수렴을 보장하는 배경(backtracking) 경사하강법의 변종인 Unbounded Backtracking Gradient Descent를 제안한다. 주요 기여는 이전 연구와 동일한 일반 조건 하에서 수렴성을 증명하는 바이며, 이제는 학습률의 유계성 조건을 요구하지 않아, 나쁜 국소 최소값을 회피하는 데 있어 이론적 안정성을 향상시킨다.
In unconstrained optimisation on an Euclidean space, to prove convergence in Gradient Descent processes (GD) $x_{n+1}=x_n-δ_n abla f(x_n)$ it usually is required that the learning rates $δ_n$'s are bounded: $δ_n\leq δ$ for some positive $δ$. Under this assumption, if the sequence $x_n$ converges to a critical point $z$, then with large values of $n$ the update will be small because $||x_{n+1}-x_n||\lesssim || abla f(x_n)||$. This may also force the sequence to converge to a bad minimum. If we can allow, at least theoretically, that the learning rates $δ_n$'s are not bounded, then we may have better convergence to better minima. A previous joint paper by the author showed convergence for the usual version of Backtracking GD under very general assumptions on the cost function $f$. In this paper, we allow the learning rates $δ_n$ to be unbounded, in the sense that there is a function $h:(0,\infty) ightarrow (0,\infty )$ such that $\lim _{t ightarrow 0}th(t)=0$ and $δ_n\lesssim \max \{h(x_n),δ\}$ satisfies Armijo's condition for all $n$, and prove convergence under the same assumptions as in the mentioned paper. It will be shown that this growth rate of $h$ is best possible if one wants convergence of the sequence $\{x_n\}$. A specific way for choosing $δ_n$ in a discrete way connects to Two-way Backtracking GD defined in the mentioned paper. We provide some results which either improve or are implicitly contained in those in the mentioned paper and another recent paper on avoidance of saddle points.
연구 동기 및 목표
- 표준 및 배경 경사하강법에서 학습률의 유계성으로 인해 나쁜 국소 최소값으로 수렴할 수 있는 한계를 해결하기 위해.
- 배경 경사하강법에서 이론적으로 무한대가 되는 학습률을 허용하면서도 임계점으로의 수렴을 유지하기 위해.
- 학습률을 제한하는 함수 $ h $ 의 성장률이 수렴성에 대해 최적임을 입증하기 위해.
- 비용 함수에 대한 최소한의 가정 하에 유계 학습률 영역에서의 수렴 결과를 무한대 학습률 영역으로 일반화하기 위해.
- 무한대 배경 경사하강법의 실용적인 이산 구현을 제안하고, Two-way Backtracking GD와 연관지기 위해.
제안 방법
- 모든 $ t \in (0,\infty) $ 에 대해 $ \lim_{t\to 0} t h(t) = 0 $ 를 만족하는 함수 $ h:(0,∞)\to(0,∞) $ 를 도입하여 학습률의 상한을 제어한다.
- Armijo 조건을 만족하는 $ \delta(x) \leq \hat{\delta}(x) \leq h(\|\nabla f(x)\|) $ 를 만족하는 $ \hat{\delta}(x) $ 를 정의한다.
- 학습률이 기울기가 작을 때 증가할 수 있도록 허용하는 업데이트 규칙 $ x_{n+1} = x_n - \hat{\delta}(x_n) \nabla f(x_n) $ 을 구성한다.
- 이산 알고리즘을 사용: $ \delta = \delta_0 $ 로 시작하고, Armijo 조건을 만족하지 못하면 $ \beta $ 로 감소시키며, 만족하고 $ \delta \leq h(\|\nabla f(x_n)\|) $ 이면 $ 1/\beta $ 로 증가시킨다.
- compactness 추론과 $ h $ 에 대한 감쇠 조건을 활용하여, 수렴 조건 하에서 $ \|x_{n+1} - x_n\| \to 0 $ 임을 증명한다.
- 이전 연구에서의 안장점 회피 및 수렴 결과를 활용하여, 임계점이 가 countably many 인 $ C^1 $ 함수에 대해 분석을 확장한다.
실험 결과
연구 질문
- RQ1학습률이 무한히 증가할 수 있도록 허용할 경우, 배경 경사하강법이 임계점으로 수렴할 수 있는가?
- RQ2수열 $ \{x_n\} $ 의 수렴성을 보장하기 위해, 학습률을 제한하는 함수 $ h $ 의 최소 성장률은 무엇인가?
- RQ3제안된 무한대 배경 경사하강법이 표준 배경 경사하강법과 동일한 가정 하에 수렴 보장을 유지하는가?
- RQ4기존 이론 프레임워크를 기반으로 하여 무한대 배경 경사하강법의 이산 구현이 정당화될 수 있는가?
- RQ5$ \lim_{t\to 0} t h(t) = 0 $ 조건이 $ \|x_{n+1} - x_n\| \to 0 $ 를 보장하기 위해 최적인가?
주요 결과
- 함수 $ f $ 가 최대 가 countably many 임계점을 가질 경우, Unbounded Backtracking GD 가 생성하는 수열 $ \{x_n\} $ 은 $ f $ 의 임계점으로 수렴하거나 무한대 방향으로 발산한다.
- 함수 $ f $ 가 $ C^1 $ 이고 수열 $ \{x_n\} $ 이 클러스터 포인트를 가질 경우, 그 점은 반드시 $ f $ 의 임계점이어야 한다.
- $ n \to \infty $ 일 때, 차이 $ \|x_{n+1} - x_n\| \to 0 $ 이 되며, $ f(x_n) \to -\infty $ 가 아닐 경우에 한하여 성립한다.
- $ h $ 의 성장률은 $ \lim_{t\to 0} t h(t) = 0 $ 으로 정의되며, 이는 수열 $ \{x_n\} $ 의 수렴성을 보장하기 위해 최적이다.
- Two-way Backtracking GD 와 유사한 이산 알고리즘은 이전 연구에서의 동일한 가정 하에 수렴을 보장한다.
- 이전 연구에서의 안장점 회피 이론 결과는 $ \nabla f $ 의 균일한 리프시츠 조건을 요구하지 않으며, 무한대 학습률 영역으로 확장된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.