Skip to main content
QUICK REVIEW

[논문 리뷰] Global Convergence of Gradient Descent for Asymmetric Low-Rank Matrix Factorization

Ye Tian, Simon S. Du|arXiv (Cornell University)|2021. 06. 27.
Sparse and Compressive Sensing Techniques참고 문헌 20인용 수 6
한 줄 요약

이 논문은 잡음 주입이나 균형 조정 정규화 없이도, 다항수렴 속도를 갖는 일정한 학습률을 사용하는 무작위 초기화된 경사하강법이 비대칭 저질러 행렬 분해에서 전역 최소값으로 수렴함을 증명한다. 저자들은 비볼록성과 균형이 맞지 않는 행렬 노름을 다루기 위해 새로운 대칭화 기법과 정량적 섭동 분석을 도입하여, 일정한 학습률을 사용하는 표준 경사하강법 하에서 수렴성을 확립한다.

ABSTRACT

We study the asymmetric low-rank factorization problem: \[\min_{\mathbf{U} \in \mathbb{R}^{m imes d}, \mathbf{V} \in \mathbb{R}^{n imes d}} \frac{1}{2}\|\mathbf{U}\mathbf{V}^ op -\mathbfΣ\|_F^2\] where $\mathbfΣ$ is a given matrix of size $m imes n$ and rank $d$. This is a canonical problem that admits two difficulties in optimization: 1) non-convexity and 2) non-smoothness (due to unbalancedness of $\mathbf{U}$ and $\mathbf{V}$). This is also a prototype for more complex problems such as asymmetric matrix sensing and matrix completion. Despite being non-convex and non-smooth, it has been observed empirically that the randomly initialized gradient descent algorithm can solve this problem in polynomial time. Existing theories to explain this phenomenon all require artificial modifications of the algorithm, such as adding noise in each iteration and adding a balancing regularizer to balance the $\mathbf{U}$ and $\mathbf{V}$. This paper presents the first proof that shows randomly initialized gradient descent converges to a global minimum of the asymmetric low-rank factorization problem with a polynomial rate. For the proof, we develop 1) a new symmetrization technique to capture the magnitudes of the symmetry and asymmetry, and 2) a quantitative perturbation analysis to approximate matrix derivatives. We believe both are useful for other related non-convex problems.

연구 동기 및 목표

  • 비볼록성과 비균형성의 존재 속에서 경사하강법의 경험적 성공과 이론적 이해 사이의 격차를 메우기 위해.
  • 일정한 학습률을 사용하는 표준 경사하강법이 다항 수렴 속도로 전역 수렴함을 증명하기 위해.
  • 소음 주입이나 정규화와 같은 인위적 수정 없이도 알고리즘이 자동 균형 유지 성질을 유지함을 입증하기 위해.
  • 기계학습 분야의 더 넓은 비볼록 최적화 문제에 적용 가능한 새로운 분석 도구를 개발하기 위해.

제안 방법

  • U와 V 행렬 간의 비대칭성을 정량화하고 제어하기 위해 새로운 대칭화 기법을 도입한다.
  • 균형이 맞지 않는 노름 하에서 행렬 도함수를 근사하기 위해 정량적 섭동 분석을 개발한다.
  • 최적화 궤적을 주성분과 잔여 성분으로 분해하여 수렴성을 단계적으로 분석한다.
  • 귀납법과 재귀적 경계를 사용하여 비대칭성(‖Bt‖F)과 오차(‖Σ−UtVt⊤‖F)의 반복 수에 따른 성장률을 제어한다.
  • 전역 초기화 단계와 국소 선형 수렴 단계로 나누어 수렴성을 확립한다.
  • 학습률 η=O(σdε²/(dσ₁³))와 초기화 스케일 ε를 선택하여 비대칭성이 유한하게 유지되고 기하급수적 오차 감소가 이루어지도록 보장한다.

실험 결과

연구 질문

  • RQ1일정한 학습률을 사용하는 표준 경사하강법이 인위적 수정 없이도 비대칭 저질러 행렬 분해에서 전역 수렴을 달성할 수 있는가?
  • RQ2균형이 맞지 않는 U와 V로 인한 비연속성은 수렴 분석에서 어떻게 다뤄질 수 있는가?
  • RQ3초기 비대칭성에도 불구하고 경사하강법이 U와 V 사이의 균형을 유지하는 메커니즘은 무엇인가?
  • RQ4이 비볼록성과 비연속성 환경에서 경사하강법의 다항 수렴 속도를 증명할 수 있는가?
  • RQ5이러한 비균형성과 비볼록성 문제를 분석하기 위해 어떤 새로운 분석 도구가 필요한가?

주요 결과

  • 일정한 학습률을 사용하는 경사하강법이 비대칭 저질러 행렬 분해 문제의 전역 최소값으로 전역적으로 수렴한다.
  • 수렴 속도는 다항식이며, 초기 단계 이후로는 O((1−ησd/2)^t)로 표현되며, δ-최적성에 도달하는 데 O(ln(σd/δ)/(ησd))회의 반복이 필요하다.
  • 학습 전반에 걸쳐 비대칭성이 유한하게 유지되며, 충분히 작은 ε에 대해 ‖Bt‖F² ≤ O(ε²)를 만족한다.
  • 학습률 η는 O(σdε²/(dσ₁³))로 선택되며, ε는 ˜O(σd/(√σ₁eb(m+n)))로 설정되어 수렴을 보장한다.
  • 증명은 비대칭성과 수렴성 간의 상호작용을 포착하는 새로운 대칭화 기법과 섭동 분석에 기반한다.
  • 결과는 경사하강법가 정규화나 잡음 주입 없이도 U와 V를 자동으로 균형 잡는다는 것을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.