Skip to main content
QUICK REVIEW

[논문 리뷰] Sharper Bounds for Regularized Data Fitting

Haim Avron, Kenneth L. Clarkson|arXiv (Cornell University)|2016. 11. 10.
Sparse and Compressive Sensing Techniques참고 문헌 28인용 수 4
한 줄 요약

이 논문은 선형 회귀, 저질서 근사, 정규화된 공분산 분석에서 행렬 스케칭의 더 날카운 자원 한계를 제시하며, 알고리즘 복잡도에 랭크 대신 통계 차원을 사용함으로써 개선한다. 릿지 정규화가 더 빠른 알고리즘을 가능하게 하며, 실행 시간이 최적 해의 통계 차원에 따라 달라지며, 이는 항상 행렬 랭크 이하이거나 그것보다 작아지고 정규화가 증가함에 따라 감소한다.

ABSTRACT

We study matrix sketching methods for regularized variants of linear regression, low rank approximation, and canonical correlation analysis. Our main focus is on sketching techniques which preserve the objective function value for regularized problems, which is an area that has remained largely unexplored. We study regularization both in a fairly broad setting, and in the specific context of the popular and widely used technique of ridge regularization; for the latter, as applied to each of these problems, we show algorithmic resource bounds in which the {\em statistical dimension} appears in places where in previous bounds the rank would appear. The statistical dimension is always smaller than the rank, and decreases as the amount of regularization increases. In particular, for the ridge low-rank approximation problem $\min_{Y,X} \lVert YX - A Vert_F^2 + λ\lVert Y Vert_F^2 + λ\lVert X Vert_F^2$, where $Y\in\mathbb{R}^{n imes k}$ and $X\in\mathbb{R}^{k imes d}$, we give an approximation algorithm needing \[ O(\mathtt{nnz}(A)) + ilde{O}((n+d)\varepsilon^{-1}k \min\{k, \varepsilon^{-1}\mathtt{sd}_λ(Y^*)\})+ \mathtt{poly}(\mathtt{sd}_λ(Y^*) \varepsilon^{-1}) \] time, where $s_λ(Y^*)\le k$ is the statistical dimension of $Y^*$, $Y^*$ is an optimal $Y$, $\varepsilon$ is an error parameter, and $\mathtt{nnz}(A)$ is the number of nonzero entries of $A$.This is faster than prior work, even when $λ=0$. We also study regularization in a much more general setting. For example, we obtain sketching-based algorithms for the low-rank approximation problem $\min_{X,Y} \lVert YX - A Vert_F^2 + f(Y,X)$ where $f(\cdot,\cdot)$ is a regularizing function satisfying some very general conditions (chiefly, invariance under orthogonal transformations).

연구 동기 및 목표

  • 자원 한계에 랭크 대신 통계 차원을 사용하여 정규화된 문제를 위한 더 빠른 행렬 스케칭 알고리즘을 개발한다.
  • 스케칭 기반 방법을 릿지 회귀, 저질서 근사, 공분산 분석를 포함한 광범위한 정규화된 문제 클래스로 확장한다.
  • 입력 데이터에 대한 분포 가정 없이 스케칭 하여 목적 함수 값이 유지되는 이론적 보장을 수립한다.
  • 최적 해의 통계 차원에 따라 실행 시간이 결정되는 효율적인 알고리즘을 제공하며, 이는 랭크 기반 경계보다 더 날카로운 경계를 제공한다.
  • 무작위 특이값 근사 기법을 사용하여 선형 시간 내에 통계 차원을 추정한다.

제안 방법

  • 하나의 하위공간과 애핀 임베딩을 유지하는 스케칭 행렬을 구성하기 위해 희소 임베딩과 샘플드 랜덤화 히어미트 변환(SRHT)을 사용한다.
  • 모든 $ x $ 에 대해 $ \|SAx\|_2 \approx \|Ax\|_2 $ 를 만족하는 스케칭 행렬 $ S $ 를 적용함으로써 목적 함수 유지 보장을 확보한다.
  • 희소 임베딩과 SRHT의 곱을 통해 단계적 스케칭 행렬 구축을 수행하여 낮은 스케칭 크기와 빠른 계산을 달성한다.
  • SVD 기반 변환을 통해 저질서 근사를 대각 형태로 감소시켜 기본 케이스에서 효율적인 계산을 가능하게 한다.
  • 무작위 알고리즘을 사용하여 $ A $ 의 첫 $ O(M) $ 개의 특이값을 애드디티브 오차 내에서 추정함으로써 통계 차원 추정을 가능하게 한다.
  • 복잡도 경계에 랭크 대신 사용되는 통계 차원 $ \operatorname{sd}_\lambda(A) = \sum_{i=1}^k \frac{1}{1 + \lambda / \sigma_i^2} $ 를 유도한다.

실험 결과

연구 질문

  • RQ1스케칭 기반 알고리즘이 정규화된 문제에 대해 랭크 대신 통계 차원을 사용함으로써 자원 한계를 향상시킬 수 있는가?
  • RQ2릿지 정규화는 저질서 근사 및 회귀 문제에서 스케칭 크기와 실행 시간에 어떤 영향을 미치는가?
  • RQ3스케칭 방법은 정규화자가 정규직교 변환에 대해 불변인 정규화된 문제로 일반화될 수 있는가?
  • RQ4선형 시간 내에 행렬의 통계 차원을 계산하는 데 드는 비용은 얼마인가?
  • RQ5고정 확률로 상수 요인 이내의 정확도로 통계 차원을 $ O(\operatorname{nnz}(A)) $ 시간 내에 추정할 수 있는가?

주요 결과

  • 릿지 저질서 근사에 대해 알고리즘은 $ O(\operatorname{nnz}(A)) + \tilde{O}((n+d)\varepsilon^{-1}k\min\{k, \varepsilon^{-1} \operatorname{sd}_\lambda(Y^*)\}) + \mathrm{poly}(\operatorname{sd}_\lambda(Y^*)\varepsilon^{-1}) $ 시간 내에 실행되며, 여기서 $ \operatorname{sd}_\lambda(Y^*) $ 는 최적의 $ Y^* $ 의 통계 차원이다.
  • 통계 차원 $ \operatorname{sd}_\lambda(A) $ 는 항상 랭크 이하이며, $ \lambda $ 가 증가함에 따라 감소하므로 더 날카로운 경계를 이끈다.
  • $ \lambda = 0 $ 인 경우 경계는 여전히 이전 연구보다 향상된 형태로 줄어들며, 비정규화된 경우에도 마찬가지다.
  • 행렬 $ A $ 의 통계 차원은 고정 확률로 $ O(\operatorname{nnz}(A)) $ 시간 내에 상수 요인 이내로 추정할 수 있다.
  • 정규화자가 정규직교 변환에 대해 불변인 경우, 스케칭 기반 알고리즘은 통계 차원에 따라 실행 시간 경계를 달성한다.
  • 스케칭 행렬 구성은 $ SA $ 가 $ O(\operatorname{nnz}(A)) $ 시간 내에 계산될 수 있도록 하며, 낮은 행 수를 유지함으로써 선형 시간 성능을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.