Skip to main content
QUICK REVIEW

[논문 리뷰] Inv-ASKIT: A Parallel Fast Diret Solver for Kernel Matrices

Chenhan D. Yu, William B. March|arXiv (Cornell University)|2016. 02. 03.
Stochastic Gradient Optimization Techniques참고 문헌 19인용 수 4
한 줄 요약

Inv-ASKIT는 계층적 저질서 구조를 ASKIT 기반 행렬 근사로 이용하여 $ olimits cal{O}(N\log N)$ 선형 시스템 $ olimits cal{\lambda I + K}$ 해법을 가능하게 하는 병렬 빠른 직접 해법이다. $ olimits cal{O}(N\log^2 N)$ 인수분해를 달성하고 4,096개 코어로 확장되며, 고차원 데이터에서 32M×32M 행렬을 처리하여 최대 피크 FLOPS의 50% 성능을 기록하여 이전 방법에 비해 다수의 주기수 개선을 이룬다.

ABSTRACT

We present a parallel algorithm for computing the approximate factorization of an $N$-by-$N$ kernel matrix. Once this factorization has been constructed (with $N \log^2 N $ work), we can solve linear systems with this matrix with $N \log N $ work. Kernel matrices represent pairwise interactions of points in metric spaces. They appear in machine learning, approximation theory, and computational physics. Kernel matrices are typically dense (matrix multiplication scales quadratically with $N$) and ill-conditioned (solves can require 100s of Krylov iterations). Thus, fast algorithms for matrix multiplication and factorization are critical for scalability. Recently we introduced ASKIT, a new method for approximating a kernel matrix that resembles N-body methods. Here we introduce INV-ASKIT, a factorization scheme based on ASKIT. We describe the new method, derive complexity estimates, and conduct an empirical study of its accuracy and scalability. We report results on real-world datasets including "COVTYPE" ($0.5$M points in 54 dimensions), "SUSY" ($4.5$M points in 8 dimensions) and "MNIST" (2M points in 784 dimensions) using shared and distributed memory parallelism. In our largest run we approximately factorize a dense matrix of size 32M $ imes$ 32M (generated from points in 64 dimensions) on 4,096 Sandy-Bridge cores. To our knowledge these results improve the state of the art by several orders of magnitude.

연구 동기 및 목표

  • 고차원 환경에서 조밀한 커널 행렬의 확장성과 악조건 문제를 해결하기 위해, 기존의 직접 및 반복 해법이 비용이 너무 많이 들기 때문에 이를 해결하고자 한다.
  • 대규모 고차원 데이터셋에 정의된 커널 행렬에 대해 $ olimits cal{O}(N\log N)$ 해법 시간과 $ olimits cal{O}(N\log^2 N)$ 인수분해 비용을 달성하는 병렬 직접 해법을 개발하고자 한다.
  • 공유 메모리 및 분산 메모리 병렬 처리를 지원하여 커널 행렬의 인수분해 및 역행렬 계산을 가능하게 하며, 변수 대역폭 및 비대칭 케이스를 포함한 다양한 커널을 지원하고자 한다.
  • 실제 데이터셋인 COVTYPE, SUSY, MNIST에서 높은 정확도와 강력한 확장성을 입증하고자 하며, 특히 극한 규모(예: 32M×32M 행렬)에서도 성능을 확보하고자 한다.
  • GMRES와 같은 반복 해법을 위한 조건부 개선자(preconditioner)를 제공하여 커널 기반 기계학습 응용에서 수렴 속도를 크게 향상시키고자 한다.

제안 방법

  • 이 방법은 ASKIT를 사용하여 커널 행렬 $K$를 블록 대각 행렬, 저질서 행렬, 희소 행렬($S$)으로 분해함으로써 계층적 저질서 근사를 가능하게 한다.
  • Sherman-Morrison-Woodbury 공식을 재귀적으로 적용하여 $\lambda I + K$를 블록 대각 및 저질서 성분으로 별도로 역행렬화함으로써 전체 복잡도를 감소시킨다.
  • 공간적 근접성과 커널 감쇠를 기반으로 하는 계층적 트리 구조를 사용하여 $ olimits cal{O}(N\log^2 N)$ 시간 내에 인수분해를 수행한다.
  • 공유 메모리 및 분산 메모리 병렬 처리를 모두 지원하며, 동적 로드 밸런싱과 통신을 최소화하는 데이터 레이아웃을 통해 오버헤드를 최소화한다.
  • 반복 해법을 위한 경우, Inv-ASKIT는 조건부 개선자로 사용되며, $ olimits cal{\tilde{K}}$의 역행렬을 초기 추정치로 적용하여 GMRES 수렴 속도를 가속화한다.
  • 각 커널 항목 평가에 $ olimits cal{O}(d)$ 시간만 필요하므로 고차원 입력 공간에 적합하다.

실험 결과

연구 질문

  • RQ1커널 행렬을 위한 직접 해법이 고차원 데이터에서 높은 정확도를 유지하면서도 $ olimits cal{O}(N\log N)$ 해법 시간을 달성할 수 있는가?
  • RQ2계층적 저질서 행렬 근사를 통해 공유 및 분산 메모리 시스템에서 조밀한 커널 행렬의 확장 가능한 병렬 인수분해 및 역행렬 계산이 가능한가?
  • RQ3GMRES에 조건부 개선자로 사용되었을 때, Inv-ASKIT는 커널 리지 회귀에서 Krylov 반복 방법에 비해 정확도와 수렴 속도 면에서 어떻게 비교되는가?
  • RQ4극한 규모의 데이터셋(예: 32M×32M 행렬)과 대규모 코어 수(예: 4,096개 코어)에서 Inv-ASKIT의 실용적 확장성은 어떠한가?
  • RQ5대칭성 가정 없이도 변수 대역폭 및 비대칭 커널을 처리할 수 있는가?

주요 결과

  • Inv-ASKIT는 4,096개 코어에서 32M×32M 커널 행렬을 성공적으로 인수분해하여 최대 피크 FLOPS의 50% 성능을 기록하였으며, 이는 이전 최첨단 기법에 비해 다수의 주기수 개선을 의미한다.
  • COVTYPE 데이터셋(54차원에서 0.5M 점)에서 Inv-ASKIT는 $ olimits cal{\tilde{K}}$를 사용해 96%의 분류 정확도를 달성했고, 근접 이웃 희소 보정 $S$를 포함하면 97%로 향상되었다.
  • SUSY 데이터셋(8차원에서 4.5M 점)에서는 79%의 정확도를, MNIST 데이터셋(784차원에서 2M 점)에서는 커널 회귀 작업에서 100%의 정확도를 달성했다.
  • GMRES에 조건부 개선자로 사용되었을 때, Inv-ASKIT는 몇 가지 실험에서 반복 횟수를 100회에서 0회(즉각 수렴)로 줄여 높은 정확도와 효과적인 조건부 개선을 입증했다.
  • 약한 확장성 실험에서 Inv-ASKIT는 4,096개 코어를 전반적으로 높은 효율성으로 유지하였으며, 통신 및 계산 비용이 유리하게 스케일링되었다.
  • 비조건부 GMRES 대비 2배에서 3배의 속도 향상을 기록하였고, 합성 및 실세계 데이터셋 모두에서 강력한 확장성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.