[논문 리뷰] Solving Empirical Risk Minimization in the Current Matrix Multiplication Time
이 논문은 조건수와 독립적인 시간 복잡도로 경험적 위험 최소화(Empirical Risk Minimization, ERM) 문제를 해결하는 새로운 내부점 방법을 제안한다. 이는 밀도 높은 가중치 갱신을 효율적으로 처리할 수 있는 강력한 결정론적 중심경로와 고도로 최적화된 데이터 구조를 도입함으로써 달성된다. 이 방법은 정확도 및 조건수에 대해 로그적 의존성을 가지며, 선형 프로그래밍과 최소 제곱법의 이전 결과를 더 넓은 범위의 볼록 ERM 문제로 일반화한다. 복잡도는 $O^*(n^\ho \log(n/\delta))$이며, $\rho \approx 2.38$이다.
Many convex problems in machine learning and computer science share the same form: \begin{align*} \min_{x} \sum_{i} f_i( A_i x + b_i), \end{align*} where $f_i$ are convex functions on $\mathbb{R}^{n_i}$ with constant $n_i$, $A_i \in \mathbb{R}^{n_i imes d}$, $b_i \in \mathbb{R}^{n_i}$ and $\sum_i n_i = n$. This problem generalizes linear programming and includes many problems in empirical risk minimization. In this paper, we give an algorithm that runs in time \begin{align*} O^* ( ( n^ω + n^{2.5 - α/2} + n^{2+ 1/6} ) \log (n / δ) ) \end{align*} where $ω$ is the exponent of matrix multiplication, $α$ is the dual exponent of matrix multiplication, and $δ$ is the relative accuracy. Note that the runtime has only a log dependence on the condition numbers or other data dependent parameters and these are captured in $δ$. For the current bound $ω\sim 2.38$ [Vassilevska Williams'12, Le Gall'14] and $α\sim 0.31$ [Le Gall, Urrutia'18], our runtime $O^* ( n^ω \log (n / δ))$ matches the current best for solving a dense least squares regression problem, a special case of the problem we consider. Very recently, [Alman'18] proved that all the current known techniques can not give a better $ω$ below $2.168$ which is larger than our $2+1/6$. Our result generalizes the very recent result of solving linear programs in the current matrix multiplication time [Cohen, Lee, Song'19] to a more broad class of problems. Our algorithm proposes two concepts which are different from [Cohen, Lee, Song'19] : $\bullet$ We give a robust deterministic central path method, whereas the previous one is a stochastic central path which updates weights by a random sparse vector. $\bullet$ We propose an efficient data-structure to maintain the central path of interior point methods even when the weights update vector is dense.
연구 동기 및 목표
- 일반적인 경험적 위험 최소화(ERM) 문제에 대해 런타임 상한을 개선함으로써, 특정 케이스에 대해서는 빠른 해법이 존재하나 일반적인 고정밀도 알고리즘이 부족한 문제의 격차를 메우는 것.
- 최근 선형 프로그래밍 문제를 행렬 곱셈 시간 내에 해결하는 결과를, 변수당 임의의 볼록 제약 조건을 가진 더 넓은 범위의 볼록 ERM 문제로 일반화하는 것.
- 정확도 $\delta$와 조건수에 대해 다항식 의존성을 피하고 로그적 의존성을 확보하는 방법을 설계하는 것.
- 이전의 확률적 접근 방식과 달리, 밀도 높은 가중치 갱신에도 효율적으로 대응할 수 있는 결정론적이고 강력한 중심경로 방법을 개발하는 것.
- 헤시안 또는 가중치 갱신 벡터가 밀도가 높을 경우에도 내부점 방법의 효율성을 유지하기 위해, 동적 경로 유지에 새로운 데이터 구조를 사용하는 것.
제안 방법
- 이전 연구에서 사용된 확률적 중심경로를 대체하여, 밀도 높은 가중치 갱신을 위한 결정론적 중심경로 방법을 제안한다.
- 헤시안 갱신이 밀도가 높은 경우에도 효율적으로 중심경로를 유지할 수 있도록 하는 새로운 데이터 구조를 도입한다. 이는 빠른 헤시안 갱신을 가능하게 한다.
- 현재 알려진 최고의 행렬 곱셈 지수 $\omega \approx 2.38$와 쌍대 지수 $\alpha \approx 0.31$를 활용하여 런타임을 근사한다.
- 랜덤 스케칭 기법을 사용하여 $b$차원 랜덤 프로젝션을 통해 행렬-벡터 곱을 근사하며, 히친체 부등식을 통해 농도 경계를 확보한다.
- 합집합 경계와 농도 부등식을 적용하여, 고확률적으로 $\|R^\top R h - h\|_\infty \leq \|h\|_2 \cdot \frac{\log(n/\delta)}{\sqrt{b}}$ 를 확보한다.
- 중심경로 프레임워크와 반복 정밀화, 경로 추적 전략을 조합하여, $\delta$-정밀도를 $O^*(n^\rho \log(n/\delta))$ 시간 내에 달성한다. 여기서 $\rho = \max(\omega, 2.5 - \alpha/2, 2 + 1/6)$이다.
실험 결과
연구 질문
- RQ1경험적 위험 최소화 문제를 현재 행렬 곱셈 지수에 맞는 시간 내에 해결할 수 있는가? 이는 조건수에 영향을 받지 않는가?
- RQ2이전의 확률적 접근 방식과 달리, 밀도 높은 가중치 갱신 상황에서도 효율성을 유지할 수 있는 결정론적 중심경로 방법을 설계할 수 있는가?
- RQ3정확도 및 조건수에 대해 로그적 의존성만 유지하면서 내부점 방법의 중심경로를 유지할 수 있는가?
- RQ4고도로 최적화된 데이터 구조를 통해 ERM 솔버의 런타임을 부드러움 또는 강력한 볼록성 파라미터에 의존하지 않도록 만들 수 있는가?
- RQ5선형 프로그래밍 솔버를 더 넓은 범위의 볼록 ERM 문제로 일반화할 때, 최소한의 런타임 오버헤드가 발생하는가?
주요 결과
- 알고리즘은 $O^*(n^\rho \log(n/\delta))$ 시간 내에 실행되며, $\rho = \max(\omega, 2.5 - \alpha/2, 2 + 1/6)$이다. 이는 밀도 높은 최소 제곱 회귀 문제에 대해 알려진 최고의 런타임과 일치한다.
- 현재의 행렬 곱셈 상한($\omega \approx 2.38$, $\alpha \approx 0.31$)을 적용하면 런타임은 $O^*(n^{2.38} \log(n/\delta))$로 단순화되며, 현재의 행렬 곱셈 시간을 달성한다.
- 이 방법은 정확도 $\delta$와 조건수에 대해 로그적 의존성을 가지며, 이는 $\delta$에 의해 캡처된다. 이로 인해 부드러움 또는 강력한 볼록성의 다항식 의존성을 피할 수 있다.
- 제안된 데이터 구조는 밀도 높은 가중치 갱신 상황에서도 효율적인 경로 유지가 가능하며, 이는 이전 내부점 방법의 주요 성능 저하 요인이다.
- 강력한 결정론적 중심경로 방법은 랜덤 흩어진 갱신에 의존하는 이전의 확률적 방법보다 안정성과 수렴 보장을 향상시킨다.
- 최근 선형 프로그래밍 문제에 대해 $O^*(n^\omega)$ 시간을 달성한 알고리즘의 결과를, 변수당 임의의 제약 조건 차원을 가진 더 넓은 범위의 볼록 ERM 문제로 일반화한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.