Skip to main content
QUICK REVIEW

[논문 리뷰] Faster Kernel Ridge Regression Using Sketching and Preconditioning

Haim Avron, Kenneth L. Clarkson|arXiv (Cornell University)|2016. 11. 10.
Sparse and Compressive Sensing Techniques참고 문헌 30인용 수 5
한 줄 요약

이 논문은 커널 리지 회귀(KRR)에 대한 새로운 전처리 기법을 제안하며, 랜덤 특징 매핑(예: 랜덤 푸리에 특징)을 사용하여 반복적 해법기를 가속화한다. 적은 수의 랜덤 특징으로 전처리기를 구성함으로써 커널 행렬의 조건수를 감소시켜, 실질적으로 선형 시간 복잡도에 가까운 O(n²) 수준으로 KRR 시스템을 빠르고 정확하게 해결할 수 있다. 이는 최대 100만 개의 예제를 포함한 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Kernel Ridge Regression (KRR) is a simple yet powerful technique for non-parametric regression whose computation amounts to solving a linear system. This system is usually dense and highly ill-conditioned. In addition, the dimensions of the matrix are the same as the number of data points, so direct methods are unrealistic for large-scale datasets. In this paper, we propose a preconditioning technique for accelerating the solution of the aforementioned linear system. The preconditioner is based on random feature maps, such as random Fourier features, which have recently emerged as a powerful technique for speeding up and scaling the training of kernel-based methods, such as kernel ridge regression, by resorting to approximations. However, random feature maps only provide crude approximations to the kernel function, so delivering state-of-the-art results by directly solving the approximated system requires the number of random features to be very large. We show that random feature maps can be much more effective in forming preconditioners, since under certain conditions a not-too-large number of random features is sufficient to yield an effective preconditioner. We empirically evaluate our method and show it is highly effective for datasets of up to one million training examples.

연구 동기 및 목표

  • n개의 데이터 포인트에 대해 O(n³) 비용이 들며 조건이 나쁜 밀집 선형 시스템을 해결해야 하는 커널 리지 회귀(KRR)의 계산적 병목 현상 해결.
  • 큰 수의 랜덤 특징을 사용할 경우 정확도를 희생하면서까지 속도를 높이는 기존의 근사 방법의 한계를 극복.
  • 직접 근사화를 위해가 아니라 정확한 KRR 시스템에서 반복적 해법기의 수렴을 향상시키기 위해 랜덤 특징 매핑을 활용한 전처리 전략 개발.
  • 적은 수의 랜덤 특징을 사용해 커널 행렬의 조건수를 제한함으로써, 빠른 런타임과 함께 높은 정확도의 KRR 해를 달성.
  • 최대 100만 개의 학습 예제를 포함한 대규모 데이터셋에서 이 방법의 효과성을 입증하며 일반화 성능을 손상시키지 않는다.

제안 방법

  • 커널 함수를 직접 근사하기보다는, 커널 행렬에 적용된 랜덤 특징 매핑(예: 랜덤 푸리에 특징)을 사용해 전처리기를 구성.
  • 랜덤 특징 매핑을 활용해 커널 행렬의 저랭크 근사를 생성하고, 이를 선형 시스템 (K + λI)c = y의 전처리기로 사용.
  • 이른바 켈리브-스브스페이스 방법(예: 코그래디언 기반 방법)을 적용해 전처리된 시스템을 푸르며, 개선된 조건수 덕분에 수렴 속도가 크게 향상됨.
  • 이론적 분석에 따르면 다항식 커널의 경우 통계 차원(효용 자유도)에 비례하는 수의 랜덤 특징을 선택하면 조건수가 유한하게 유지됨.
  • 전처리기는 s가 n보다 훨씬 작은 수임을 고려해 O(ns²) 시간에 효율적으로 계산 가능하며, 여기서 s는 랜덤 특징의 수이다.
  • 스케칭(랜덤 특징을 통한)과 전처리를 조합함으로써 O(n²)와 O(n³) 사이의 런타임을 달성하며, 실질적으로 O(n²) 수준으로 동작함.

실험 결과

연구 질문

  • RQ1랜덤 특징 매핑을 커널의 직접 근사가 아니라 정확한 KRR를 위한 반복적 해법기의 수렴을 가속화하기 위한 전처리기로 효과적으로 사용할 수 있는가?
  • RQ2랜덤 특징의 수와 전처리된 커널 행렬의 조건수 사이의 이론적 관계는 무엇인가?
  • RQ3적은 수의 랜덤 특징을 전처리기로 사용할 경우, 많은 특징을 사용하는 직접 근사 방법보다 수렴 속도와 일반화 성능이 더 우수한가?
  • RQ4이러한 방법은 최대 100만 개의 예제를 포함한 대규모 데이터셋에서 어떻게 스케일링되는가?
  • RQ5불안정한 조건의 커널 행렬에 대해 비전처리 방법 대비 이 전처리 접근이 반복적 해법기의 수렴성과 강건성에 어떻게 기여하는가?

주요 결과

  • 제안된 전처리 기법은 실질적으로 선형 시간 복잡도에 가까운 O(n²) 수준으로 스케일링되며, 표준 O(n³) 직접 방법보다 뛰어난 성능을 보인다.
  • 다항식 커널의 경우 통계 차원에 비례하는 수의 랜덤 특징을 사용하면 전처리된 시스템의 조건수가 상수로 유 bounds됨.
  • 최대 100만 개의 예제를 포함한 데이터셋에서, 비전처리 코그래디언 기반 방법과 최신 기술 수준의 랜덤 특징 기반 해법기보다 더 낮은 테스트 오차율을 달성함.
  • 비전처리 코그래디언 기반 방법보다 더 강건함: MNIST-200K와 MNIST-300K에서 비전처리 방법은 수렴에 실패했지만, 전처리 방법은 성공적으로 수렴했고 더 낮은 오차율을 기록함.
  • 정확도 허용 오차를 10⁻³으로 설정했을 때도 일반화 오차가 10⁻²일 때와 거의 동일한 수준이었으며, 이는 더 엄격한 허용 오차가 추가적인 이점을 주지 않음을 시사함. 이는 고정밀도 결과를 얻기 위해 10⁻³을 사용하는 것이 타당함을 검증함.
  • 큰 수의 랜덤 특징이 필요하지 않음에도 불구하고 높은 모델 정확도를 유지하며, 직접 랜덤 특징 근사 방법에서 흔히 발생하는 성능 저하를 피함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.