[논문 리뷰] Asymptotic behaviour of learning rates in Armijo's condition
이 논문은 백트래킹 경사하강법에서 아르미조 조건 내의 학습률의 점근적 행동을 분석한다. 수렴이 비퇴화 임계점으로 이루어질 경우, 학습률은 유계여야 하며, 이는 한계점에서 헤시안 노름과 그 역행렬의 노름에 따라 명시적인 정량적 한계를 가짐을 증명한다. 이는 비퇴화 최소점 근처에서는 유계가 아닌 백트래킹 경사하강법이 표준 백트래킹 경사하강법과 유사하게 행동하지만, 퇰그레드 임계점 근처에서는 상당히 다를 수 있음을 보여준다.
Fix a constant $00$, we say that Armijo's condition is satisfied if $f(x-δ abla f(x))-f(x)\leq -αδ|| abla f(x)||^2$. It is a basis for the well known Backtracking Gradient Descent (Backtracking GD) algorithm. Consider a sequence $\{x_n\}$ defined by $x_{n+1}=x_n-δ_n abla f(x_n)$, for positive numbers $δ_n$ for which Armijo's condition is satisfied. We show that if $\{x_n\}$ converges to a non-degenerate critical point, then $\{δ_n\}$ must be bounded. Moreover this boundedness can be quantified in terms of the norms of the Hessian $ abla ^2f$ and its inverse at the limit point. This complements the first author's results on Unbounded Backtracking GD, and shows that in case of convergence to a non-degenerate critical point the behaviour of Unbounded Backtracking GD is not too different from that of usual Backtracking GD. On the other hand, in case of convergence to a degenerate critical point the behaviours can be very much different. We run some experiments to illustrate that both scenrios can really happen. In another part of the paper, we argue that Backtracking GD has the correct unit (according to a definition by Zeiler in his Adadelta's paper). The main point is that since learning rate in Backtracking GD is bound by Armijo's condition, it is not unitless.
연구 동기 및 목표
- 비퇴화 임계점으로 수렴하는 동안 학습률이 무한대로 증가할 수 있는지 조사하기 위해.
- 비퇴화 및 퇴화 임계점 근처에서 비퇴화 임계점으로 수렴할 경우 비퇴화 백트래킹 GD와 표준 백트래킹 GD의 학습률 점근적 행동을 비교하기 위해.
- 물리적 차원 분석을 기반으로 백트래킹 GD의 단위 정합성(단위 정확성)을 확립하여 표준 및 적응형 방법의 핵심 한계를 해결하기 위해.
- 특히 한계점에서 헤시안 성질과 관련하여 아르미조 조건 하에서 백트래킹 GD의 수렴 행동에 대한 이론적 근거를 제공하기 위해.
제안 방법
- 비퇴화 임계점 $x_\infty$ 근처에서 $f$ 와 $\nabla f$ 의 테일러 전개를 사용하여 $f(x_n) - f(x_\infty)$ 와 $\|\nabla f(x_n)\|$ 의 점근적 추정을 유도한다.
- 학습률 $\delta_n$ 에 대한 상한을 유도하기 위해 아르미조 조건 $f(x_n - \delta_n \nabla f(x_n)) - f(x_n) \leq -\alpha \delta_n \|\nabla f(x_n)\|^2$ 을 적용한다.
- 헤시안 $\nabla^2 f(x_\infty)$ 와 그 역행렬의 연산자 노름 추정을 사용하여 $\delta_n$ 의 상한을 정량화한다.
- 차원 일致성 분석을 수행: $\delta(x_n)$ 이 단위 $\text{Unit}(x)^2 / \text{Unit}(f)$ 를 가지며, 아르미조 조건이 단위 정확하기 위해서는 $\alpha$ 가 무차원이어야 함을 보여준다.
- 백트래킹 GD를 표준 GD, 모멘타움, 아다그레드, 뉴턴 방법, 감소하는 GD와 비교하여 단위 정확성 측면에서 분석한다.
- 수치 실험을 수행하여 비퇴화 임계점의 성격에 따라 실제로 유계 또는 비유계 학습률 행동이 모두 발생할 수 있음을 시각화한다.
실험 결과
연구 질문
- RQ1비퇴화 백트래킹 GD에서 학습률이 무한대로 증가할 수 있으며, 동시에 비퇴화 임계점으로 수렴할 수 있는가?
- RQ2한계점에서 헤시안과 그 역행렬에 대해 학습률 $\delta_n$ 의 정량적 상한은 무엇인가?
- RQ3비퇴화 임계점과 퇴화 임계점으로 수렴할 경우 비퇴화 백트래킹 GD와 표준 백트래킹 GD의 행동은 어떻게 다를까?
- RQ4백트래킹 GD는 지엘러의 단위 분석 기준으로 단위 정확한가? 다른 최적화 방법과 비교해보면 어떻게 되는가?
- RQ5백트래킹 GD에서 학습률을 함수 스케일과 독립적으로 선택할 수 있으며, 이는 수렴성과 안정성에 어떤 영향을 미치는가?
주요 결과
- 학습률 $\delta_n$ 이 수렴하는 비퇴화 임계점으로 수렴하는 수열 $\{x_n\}$ 이 아르미조 조건을 만족할 경우, $\delta_n$ 은 반드시 유계여야 한다.
- 학습률 $\delta_n$ 의 상한은 $\|\nabla^2 f(x_\infty)\|$ 와 $\|\nabla^2 f(x_\infty)^{-1}\|$ 에 의해 정량적으로 제어되며, 큰 $n$ 에 대해 $\alpha \delta_n \leq \frac{1}{2}(\|\nabla^2 f(x_\infty)\| + \epsilon)(\|\nabla^2 f(x_\infty)^{-1}\| + \epsilon)^2$ 이 성립한다.
- 반면에 퇴화 임계점으로 수렴할 경우 비퇴화 백트래킹 GD의 학습률은 유계 없이 증가할 수 있으며, 이는 행동상의 근본적인 차이를 보여준다.
- 백트래킹 GD는 단위가 정확하다: 학습률 $\delta(x_n)$ 은 단위 $\text{Unit}(x)^2 / \text{Unit}(f)$ 를 가지며, 아르미조 조건이 단위 정확하기 위해서는 $\alpha$ 가 무차원이어야 한다.
- 표준 GD와 감소하는 GD는 단위가 정확하지 않으며, 뉴턴 방법은 단위가 정확하지만 내림내림 방법이 보장되지 않는다.
- 표준 GD에서 $\delta_0 = 1/L$ (여기서 $L$ 은 $\nabla f$ 의 리프시츠 상수) 를 선택할 경우 단위 정확성이 확보되며, 이러한 방법은 백트래킹 GD의 특수한 경우이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.