Skip to main content
QUICK REVIEW

[논문 리뷰] Why are Big Data Matrices Approximately Low Rank?

Madeleine Udell, Alex Townsend|arXiv (Cornell University)|2017. 05. 21.
Sparse and Compressive Sensing Techniques참고 문헌 34인용 수 8
한 줄 요약

이 논문은 추천 시스템 및 유전체학과 같은 응용 분야에서 큰 데이터 행렬이 왜 근사적으로 낮은 질서를 가질 수 있는지에 대해, 유한하고 매끄러운 잠재 변수의 함수로 모델링함으로써 설명한다. 이러한 행렬이 행렬 크기의 로그 비율로 증가하는 낮은 질서의 행렬에 의해 고정된 오차 이내로 근사될 수 있음을 증명하며, 데이터 과학에서 낮은 질서 방법의 广범한 성공에 대한 이론적 기반을 제공한다.

ABSTRACT

Matrices of (approximate) low rank are pervasive in data science, appearing in recommender systems, movie preferences, topic models, medical records, and genomics. While there is a vast literature on how to exploit low rank structure in these datasets, there is less attention on explaining why the low rank structure appears in the first place. Here, we explain the effectiveness of low rank models in data science by considering a simple generative model for these matrices: we suppose that each row or column is associated to a (possibly high dimensional) bounded latent variable, and entries of the matrix are generated by applying a piecewise analytic function to these latent variables. These matrices are in general full rank. However, we show that we can approximate every entry of an $m imes n$ matrix drawn from this model to within a fixed absolute error by a low rank matrix whose rank grows as $\mathcal O(\log(m + n))$. Hence any sufficiently large matrix from such a latent variable model can be approximated, up to a small entrywise error, by a low rank matrix.

연구 동기 및 목표

  • 랜덤 행렬이 일반적으로 전위수를 가지지만 실제 세계의 데이터 행렬에서 낮은 질서의 구조가 널리 퍼져 있는 이유를 설명하기 위해.
  • 자연스럽게 근사적으로 낮은 질서의 행동을 유도하는 매끄럽고 유한한 잠재 변수를 기반으로 데이터 행렬의 생성 모델을 정식화하기 위해.
  • 이러한 행렬이 낮은 질서의 행렬에 의해 요소별로 근사될 수 있는 오차에 대한 이론적 경계를 설정하기 위해.
  • 주어진 근사 오차를 위해 필요한 질서가 매트릭스 크기와 함께 느리게(로그적으로) 증가함을 입증하여 낮은 질서 기법의 효율성을 정당화하기 위해.
  • 명백한 저차원 물리적 해석(예: 주제 또는 장르)이 존재하지 않을 때조차도 낮은 질서 근사가 효과적인 이유에 대한 이론적 기반을 제공하기 위해.

제안 방법

  • 각 행과 열이 고차원 공간 내의 유한하고 매끄러운 잠재 변수에 대응되는 잠재 변수 모델을 제안한다.
  • 행렬 요소들을 잠재 변수의 조각별 해석 함수로 모델링함으로써 매끄럽고 유한한 성질을 보장한다.
  • Johnson–Lindenstrauss 레마를 적용하여 고차원 잠재 점들이 낮은 차원 공간에 임베딩될 수 있으며, 이로 인해 쌍별 거리가 근사적으로 유지됨을 보여준다.
  • 이 임베딩을 이용해 최대 요소별 오차를 제어하는 낮은 질서 근사 행렬을 구성한다.
  • 행렬 크기 $n$과 오차 허용 범위 $ε$에 따라 $\epsilon$-랭크(요소별 오차 $\leq \epsilon$를 만족하는 데 필요한 최소 질서)의 이론적 경계를 유도한다.
  • 대칭 모델(예: 그래프론)과 조각별 해석 함수로의 분석을 확장하여 유사한 로그적 질서 증가를 보여준다.

실험 결과

연구 질문

  • RQ1랜덤 행렬이 일반적으로 전위수를 가지지만, 데이터 과학 분야에서 큰 실제 세계의 데이터 행렬이 왜 자주 낮은 질서의 구조를 보이는가?
  • RQ2고차원 잠재 변수에서 유도된 행렬에서 낮은 질서의 구조가 어떻게 나타나는지를 설명할 수 있는 이론적 모델이 존재하는가?
  • RQ3잠재 공간의 차원과 주어진 요소별 오차 이내로 행렬을 근사하기 위해 필요한 질서 사이의 관계는 무엇인가?
  • RQ4매끄럽고 유한한 잠재 변수 모델 하에서 고정된 요소별 오차를 위해 필요한 질서가 매트릭스 크기와 함께 느리게(예: 로그적으로) 증가하는가?
  • RQ5해석 가능한 저차원 구조(예: 주제 또는 장르)가 존재하지 않을 경우에도 낮은 질서 근사는 어느 정도 효과적일 수 있는가?

주요 결과

  • 좋은 잠재 변수 모델에서 유도된 행렬은 고정된 절대 오차 $\epsilon$ 이내로 근사될 수 있으며, 이에 필요한 질서는 $\mathcal{O}(\log n / \epsilon^2)$ 비율로 증가한다.
  • 주어진 오차 허용 범위 $\epsilon$에 대해, 좋은 잠재 변수 모델에서 유도된 $n \times n$ 행렬의 $\epsilon$-랭크는 $n$에 대해 로그적으로 증가하며, 선형으로는 증가하지 않는다.
  • 기저의 잠재 구조가 고차원이거나 비선형일지라도 결과는 유지되며, 잠재 변수에서 행렬 요소로의 함수가 조각별 해석적이면 된다.
  • Johnson–Lindenstrauss 레마는 낮은 차원의 임베딩이 낮은 질서 근사에 필요한 구조를 유지함을 보여주는 데 핵심적인 역할을 한다.
  • 이론적 경계는 충분히 큰 $n$에 대해 고정된 $\epsilon$를 위해 필요한 질서가 $n$보다 훨씬 작다는 것을 보여주며, 낮은 질서 기법의 경험적 성공을 설명한다.
  • 수치 실험은 이론적 예측을 확인한다: 큰 $n$에서는 필요한 질서가 약간 로그적으로 증가하지만, 작은 $n$이나 작은 $\epsilon$에서는 선형적으로 증가할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.