Skip to main content
QUICK REVIEW

[논문 리뷰] Data-dependent kernels in nearly-linear time

Guy Lever, Tom Diethe|arXiv (Cornell University)|2011. 10. 20.
Gaussian Processes and Bayesian Inference참고 문헌 22인용 수 8
한 줄 요약

이 논문은 데이터에 따라 결정되는 커널을 구성하기 위한 거의 선형 시간 방법을 제안한다. 이 방법은 소규모 표본을 사용해 내재 정규화를 근사함으로써, 확장 가능한 준지도 학습 및 무 supervision 학습을 가능하게 한다. 이 접근법은 전체 데이터 정규화를 보간을 통한 저랭크 근사로 대체하여, LapSVM과 유사한 성능을 달성하면서도 계산 복잡도를 입체에서 거의 선형 시간으로 감소시킨다. 이는 64,000개의 데이터 포인트를 포함한 데이터셋에서도 적용 가능하다.

ABSTRACT

We propose a method to efficiently construct data-dependent kernels which can make use of large quantities of (unlabeled) data. Our construction makes an approximation in the standard construction of semi-supervised kernels in Sindhwani et al. 2005. In typical cases these kernels can be computed in nearly-linear time (in the amount of data), improving on the cubic time of the standard construction, enabling large scale semi-supervised learning in a variety of contexts. The methods are validated on semi-supervised and unsupervised problems on data sets containing upto 64,000 sample points.

연구 동기 및 목표

  • 표준 준지도 학습 커널 구성에서 발생하는 입체 시간 복잡도 문제를 해결함으로써, 대규모 데이터셋에 대한 확장성을 향상시키기 위해.
  • 정규화 행렬을 구성하는 데 사용되는 점의 수를 함수 평가에 사용되는 점의 수에서 분리함으로써, 커널 방법에서 대량의 무 supervision 데이터를 활용할 수 있도록 하기 위해.
  • 완전한 커널 방법에 가까운 성능를 유지하면서도 계산 비용이 효율적인 내재 정규화의 근사치를 개발하기 위해.
  • 다양한 크기의 데이터셋, 특히 64,000개의 샘플을 포함한 데이터셋에서 분류 및 클러스터링 작업에 대해 방법을 검증하기 위해.

제안 방법

  • 이 방법은 모든 n개의 점이 아닌 소규모 표본에 대해서만 함수를 측정함으로써 표준 데이터에 따라 결정되는 커널을 근사한다.
  • 함수 값이 표본에서 보간을 통해 계산되며, 정규화 행렬 Q의 의사역행렬을 사용하여 근사 내재 정규화를 구성한다.
  • 결과적으로 얻어진 정규화 regQ(h*)는 부드러운 함수에 대해 전체 정규화 regQ(h)를 근사하며, 계산 비용을 감소시킨다.
  • 이러한 감소된 정규화 성분을 포함하는 재생 핵 힐버트 공간(RKHS)에서 커널이 구성된다.
  • 거의 선형 시간 내에 커널 행렬을 계산하기 위해, 조합적 조건부 행렬을 사용한 조건부 켤레 기울기와 같은 효율적인 선형 시스템 해법기가 사용된다.
  • 이 방법은 어떤 커널 방법에도 적용 가능하며, SVM과 K-means 클러스터링을 통해 검증되었다.

실험 결과

연구 질문

  • RQ1완전한 커널 방법의 성능을 유지하면서도 거의 선형 시간 내에 데이터에 따라 결정되는 커널을 구성할 수 있는가?
  • RQ2모든 데이터 포인트가 아닌 소규모 표본에서 함수를 측정하는 것이 내재 정규화의 좋은 근사치를 제공하는가?
  • RQ3표준 준지도 학습 커널 구성이 비현실적이게 되는 대규모 데이터셋—예를 들어 64,000개의 데이터 포인트—에서도 이 방법이 확장 가능한가?
  • RQ4이 효율적인 커널의 성능가 표준 RBF 커널과 대부분의 무 supervision 데이터를 기각하는 '예산' LapSVM에 비해 어떻게 되는가?

주요 결과

  • 이 방법은 준지도 학습 커널을 거의 선형 시간 내에 계산하여, 정규화 행렬 Q의 비제로 원소 수에 대해 입체 시간에서 선형 시간으로 복잡도를 감소시켰다.
  • 64,000개의 점을 포함한 MNIST 데이터셋에서 커널은 3분 이내에 계산되었으며, 실용적인 확장성을 입증했다.
  • 대규모 데이터셋에서 이 효율적 커널은 RBF 커널과 '예산' LapSVM보다 성능이 뛰어나, 더 많은 무 supervision 데이터를 활용한 데서 유의미한 이점을 보였다.
  • 작은 데이터셋(예: 1,250개의 점)에서는 전체 LapSVM과 유사한 성능를 달성했다.
  • 클러스터링 실험에서, 500개의 기저 점만을 사용한 방법이 1,000개 점을 포함한 전체 LapSVM 커널의 성능에 근접한 결과를 보였다.
  • 조건부 켤레 기울기 해법기는 약 선형 스케일링을 보였지만, MATLAB의 'backslash' 연산자는 더 큰 데이터셋에서 초선형 성장을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.