Skip to main content
QUICK REVIEW

[논문 리뷰] CUR Low Rank Approximation of a Matrix at Sublinear Cost

Go, Soo, Qi Luan|arXiv (Cornell University)|2019. 06. 10.
Sparse and Compressive Sensing Techniques참고 문헌 40인용 수 6
한 줄 요약

이 논문은 크기의 큰 클래스인 흐린 인자-정규분포 행렬을 포함한 여러 행렬에 대해, 서브라인어 비용에서 Cross-Approximation(C-A) 및 기본 알고리즘을 사용하여 CUR 저질서 근사(LRA)에 대한 이론적 보장을 수립한다. 이는 대부분의 낮은 질서 구조에 근접하는 행렬에 대해 높은 확률(whp)로 정확한 LRA를 계산함을 증명하며, 특히 무작위 사전 처리를 통합할 경우 더욱 그렇다. 또한 C-A를 무작위 스케칭 방법과 이론적으로 연결한다.

ABSTRACT

Low rank approximation of a matrix (hereafter LRA) is a highly important area of Numerical Linear and Multilinear Algebra and Data Mining and Analysis. One can operate with an LRA at sublinear cost -- by using much fewer memory cells and flops than an input matrix M has entries. For worst case inputs one cannot compute even a reasonably close LRA at sublinear cost, but in computational practice accurate LRAs, even in their memory efficient form of CUR LRAs, are routinely obtained at sublinear cost for large and important classes of matrices, in particular by means of Cross-Approximation iterations, which specialize Alternating Direction techniques to LRA. We identify some classes of matrices for which CUR LRA are computed at sublinear cost as well as some sublinear cost LRA algorithms that are empirically accurate for large classes of inputs. Some of our techniques and concepts can be of independent interests.

연구 동기 및 목표

  • 서브라인어 비용에서 정확한 저질서 근사를 계산하는 데 성공한 경험적 결과를 공식적으로 정당화하기 위해.
  • 낮은 질서 구조에 근접하는 충분히 가까운 행렬을 갖는 광범위한 클래스의 행렬에 대해, 서브라인어 비용 LRA 알고리즘—특히 C-A 및 기본 알고리즘—의 정확도를 분석하기 위해.
  • 무작위 사전 처리(예: 정규분포, SRHT, Rademacher 행렬을 통한)가 어떤 낮은 질서 근사에 근접하는 행렬이라도 흐린 인자-정규분포 행렬로 변환함으로써 정확한 서브라인어 LRA를 가능하게 함을 보여주기 위해.
  • 사전 처리 및 부피 최대화 원리를 통해 C-A 반복과 무작위/스케칭 LRA 알고리즘 간의 이론적 연결 고리를 구축하기 위해.
  • 초기 서브라인어 LRA를 반복적으로 개선하는 것이 정확도를 더욱 향상시킬 수 있으며, 초기 근사가 빈약하더라도 여전히 효과가 있음을 보여주기 위해.

제안 방법

  • 낮은 질서 근사에 근접하는 행렬의 큰 부분집합으로서, i.i.d. 표준 정규분포를 갖는 랜덤 행렬 $G$ 및 $H$로 정의된 흐린 인자-정규분포 행렬의 클래스를 도입한다.
  • 부분행렬의 부피 최대화를 통해 약한 최대 프로젝티브 부피를 정의하며, C-A 및 기본 알고리즘이 이러한 고부피 부분행렬을 선택하는 경향이 있음을 보여준다.
  • 집중 불등식과 유니온 바운드를 적용하여 선택된 부분행렬의 부피와 최대 부피의 비율에 대한 높은 확률의 경계를 유도한다.
  • 기대 질서 $r$를 갖는 양면 인자-정규분포 행렬 $W = G\Sigma H$에 대해, $p,q > 2r$개의 행/열을 갖는 부분행렬 $W_{\mathcal{I},\mathcal{J}}$는 높은 확률에서 $\big(\frac{1+\theta}{1-\phi}\big)^r \big(\frac{(p+r)(q+r)}{pq}\big)^{r/2}$-약한 최대 $r$-프로젝티브 부피를 갖는다.
  • 정규분포, SRHT, 또는 Rademacher 행렬을 통한 무작위 사전 처리가 낮은 질서 근사에 근접하는 어떤 행렬이라도 소규모 노름 흐린 인자-정규분포 행렬로 변환함으로써 C-A 또는 기본 알고리즘을 통한 정확한 서브라인어 LRA를 가능하게 함을 보여준다.
  • 사전 처리 하에 동등한 행동을 보임을 통해 수정된 C-A 반복이 무작위 및 스케칭 LRA 알고리즘과 연결됨을 보이며, 이전에는 인식되지 않았던 연결 고리를 드러낸다.

실험 결과

연구 질문

  • RQ1C-A 및 기본 알고리즘과 같은 서브라인어 비용 LRA 알고리즘이 낮은 질서 근사에 근접하는 큰 클래스의 행렬에 대해 정확한 CUR 근사를 계산할 수 있는가?
  • RQ2흐린 인자-정규분포 행렬에 대해 C-A 및 기본 알고리즘의 이론적 정확도 보장은 무엇이며, 이는 최적에 얼마나 가까운가?
  • RQ3무작위 사전 처리(예: 정규분포 또는 Rademacher 행렬을 통한)가 일반 행렬의 서브라인어 LRA 정확도를 어떻게 향상시키는가?
  • RQ4C-A 반복과 무작위/스케칭 LRA 알고리즘 간의 관계는 무엇이며, 이를 공식화할 수 있는가?
  • RQ5초기 서브라인어 LRA의 반복적 개선이 정확도를 더욱 향상시킬 수 있으며, 이러한 방법이 작동하는 조건은 무엇인가?

주요 결과

  • C-A 및 기본 알고리즘은 낮은 질서 근사에 근접하는 행렬의 큰 부분집합, 특히 흐린 인자-정규분포 행렬에 대해 높은 확률(whp)로 정확한 CUR LRA를 계산한다.
  • 기대 질서 $r$를 갖는 이중면 인자-정규분포 행렬 $W = G\Sigma H$에 대해, $p,q > 2r$개의 행/열을 갖는 부분행렬 $W_{\mathcal{I},\mathcal{J}}$는 확률 최소 $1 - 2\exp(-\theta r/4) - 2\exp(-\phi^2 r/2)$로 $\big(\frac{1+\theta}{1-\phi}\big)^r \big(\frac{(p+r)(q+r)}{pq}\big)^{r/2}$-약한 최대 $r$-프로젝티브 부피를 갖는다.
  • 정규분포, SRHT, 또는 Rademacher 행렬을 통한 무작위 사전 처리가 낮은 질서 근사에 근접하는 어떤 행렬이라도 소규모 노름 흐린 인자-정규분포 행렬로 변환함으로써 C-A 또는 기본 알고리즘을 통한 정확한 서브라인어 LRA를 가능하게 한다.
  • C-A 및 기본 알고리즘에 의해 계산된 LRA의 기대 오차 노름은 최적에 대해 상수 배수 이내에 머무르며, 최적에 무한히 가까운 것은 아니므로 상대 오차 LRA는 아니다.
  • 실험적 결과는 이론적 오차 추정치가 과도하게 낙관적일 수 있으며, 특히 C-A 알고리즘의 경우 이론적 경계가 실제 성능을 반영하지 못함을 시사한다.
  • 초기 서브라인어 LRA의 반복적 개선은 정확도를 크게 향상시킬 수 있으며, 특히 초기 근사가 진짜 낮은 질서 구조에 충분히 가까울 경우 더욱 그렇다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.