Skip to main content
QUICK REVIEW

[논문 리뷰] Towards a Zero-One Law for Entrywise Low Rank Approximation.

Zhao Song, David P. Woodruff|arXiv (Cornell University)|2018. 11. 04.
Stochastic Gradient Optimization Techniques참고 문헌 13인용 수 5
한 줄 요약

이 논문은 근사 단조성과 근사 삼각 부등식을 만족하는 임의의 함수 $ g $ 에 대해 일반적인 프레임워크를 제안하며, 다항수($ k $) 근사 알고리즘을 제공한다. 오차 항목이 유한한 $ (1+\gamma) $-모멘트를 가지는 i.i.d. 분포를 따를 경우 $ \ell_1 $ 손실에 대해 $ (1+\epsilon) $-근사도를 달성하며, 이 모멘트 조건이 필수적임을 보여준다.

ABSTRACT

There are a number of approximation algorithms for NP-hard versions of low rank approximation, such as finding a rank-$k$ matrix $B$ minimizing the sum of absolute values of differences to a given matrix $A$, $\min_{ extrm{rank-}k~B}\|A-B\|_1$, or more generally finding a rank-$k$ matrix $B$ which minimizes the sum of $p$-th powers of absolute values of differences, $\min_{ extrm{rank-}k~B}\|A-B\|_p^p$. Many of these algorithms are linear time columns subset selection algorithms, returning a subset of ${ m{poly}}(k\log n)$ columns whose cost is no more than a ${ m{poly}}(k)$ factor larger than the cost of the best rank-$k$ matrix. The above error measures are special cases of the following general entrywise low rank approximation problem: given an arbitrary function $g:\mathbb{R} ightarrow\mathbb{R}_{\geq0}$, find a rank-$k$ matrix $B$ which minimizes $\|A-B\|_g=\sum_{i,j}g(A_{i,j}-B_{i,j})$. A natural question is which functions $g$ admit efficient approximation algorithms? Indeed, this is a central question of recent work studying generalized low rank models. We give approximation algorithms for every function $g$ which is approximately monotone and satisfies an approximate triangle inequality, and we show both of these conditions are necessary. Further, our algorithm is efficient if the function $g$ admits an efficient approximate regression algorithm. Our algorithm handles functions which are not even scale-invariant, such as the Huber loss function. Our algorithms have ${ m{poly}}(k)$-approximation ratio in general. We further improve the approximation ratio to (1+$\epsilon$) for $\ell_1$ loss when the entries of the error matrix are i.i.d. random variables drawn from a distribution $\mu$ of which (1+$\gamma$) moment exists, for an arbitrary small constant $\gamma>0$. We also show our moment assumption is necessary.

연구 동기 및 목표

  • 효율적인 저랭크 근사가 가능한 엔트리와이즈 손실 함수 $ g $ 의 클래스를 규명하는 것.
  • Huber 및 $ \ell_p $-유사 손실 함수를 포함한 광범위한 비표준 손실 함수에 적용 가능한 통합 알고리즘 프레임워크를 개발하는 것.
  • 효율적인 근사가 가능한 조건으로서의 근사 단조성과 근사 삼각 부등식을 규명하는 것.
  • 이러한 조건이 다항수($ k $) 근사 알고리즘의 존재에 대해 필수적이고 충분한 조건임을 입증하는 것.
  • 오차 항목에 대한 미약한 확률적 가정 하에서 $ \ell_1 $ 손실에 대해 근사 비율을 $ (1+\epsilon) $ 으로 향상시키는 것.

제안 방법

  • 알고리즘은 선형 시간 컬럼 서브셋 선택 기법을 사용하여, 저랭크 근사를 형성하기 위해 $ \text{poly}(k\log n) $ 개의 컬럼을 선택한다.
  • 함수 $ g $ 가 효율적인 회귀 오рак루를 갖는다고 가정할 때, 엔트리와이즈 저랭크 문제를 $ g $ 를 기반으로 한 근사 회귀 문제로 환원한다.
  • 랜덤 프로젝션과 샘플링을 이용한 행렬 스케치를 구성함으로써, $ g $ 에 대해 오차 한계가 유지되도록 한다.
  • 함수 $ g $ 가 근사 단조성을 만족하고 근사 삼각 부등식을 충족한다면, 근사 비율이 $ \text{poly}(k) $ 로 유계임을 증명한다.
  • $ \ell_1 $ 손실의 경우, 오차 항목이 i.i.d. 이며 유한한 $ (1+\gamma) $-모멘트를 갖는 조건 하에서 농도 불등식을 활용하여 $ (1+\epsilon) $-근사도를 달성한다.
  • 이 프레임워크는 일반적이며 스케일 불변성이 없는 함수들, 예를 들어 Huber 손실과 같은 함수들을 처리할 수 있다. 이는 이전 방법들이 다루지 못한 영역이다.

실험 결과

연구 질문

  • RQ1어떤 함수 $ g $ 가 엔트리와이즈 저랭크 근사에 대해 효율적인 다항수($ k $) 근사 알고리즘을 허용하는가?
  • RQ2근사 단조성과 근사 삼각 부등식이 이러한 근사 보장에 대해 필수적이고 충분한 조건인가?
  • RQ3오차 행렬에 대한 확률적 가정 하에서 $ \ell_1 $ 손실에 대해 근사 비율을 $ (1+\epsilon) $ 으로 향상시킬 수 있는가?
  • RQ4$ \ell_1 $ 에 대해 $ (1+\epsilon) $-근사도를 가능하게 하는 오차 분포에 대한 최소 모멘트 조건은 무엇인가?
  • RQ5이 프레임워크는 Huber 손실과 같은 스케일 불변성이 없는 손실 함수에 적용될 수 있는가?

주요 결과

  • 논문은 근사 단조성과 근사 삼각 부등식이 엔트리와이즈 저랭크 근사에서 다항수($ k $) 근사 알고리즘 존재에 대해 필수적이고 충분한 조건임을 입증한다.
  • 이러한 두 조건을 만족하는 임의의 함수 $ g $ 에 대해 다항수($ k $) 근사도를 달성하는 일반적인 알고리즘을 제시한다.
  • $ \ell_1 $ 손실의 경우, 오차 행렬의 항목들이 임의의 $ \gamma > 0 $ 에 대해 유한한 $ (1+\gamma) $-모멘트를 가지는 i.i.d. 분포를 따를 때 알고리즘이 $ (1+\epsilon) $-근사도를 달성하며, 이 모멘트 조건이 최적임을 입증한다.
  • 이 프레임워크는 Huber 손실과 같은 스케일 불변성이 없는 함수들을 성공적으로 처리하며, 이전 연구에서 다루어진 스케일 불변성 또는 대칭 손실에 국한된 결과를 확장한다.
  • 근사 비율은 행렬의 차원 $ m $ 과 $ n $ 에 영향을 받지 않으며, 오직 $ k $ 에만 의존하므로 큰 행렬에 대해 확장 가능하다.
  • 함수 $ g $ 에 대해 효율적인 회귀 오라클이 존재한다고 가정할 경우, 컬럼 선택 당 선형 시간 내에 알고리즘이 실행되며, 이는 대규모 데이터에 실용적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.