Skip to main content
QUICK REVIEW

[논문 리뷰] Linearized GMM Kernels and Normalized Random Fourier Features

Ping Li|arXiv (Cornell University)|2016. 05. 18.
Face and Expression Recognition인용 수 6
한 줄 요약

이 논문은 RBF 커널 근사에서 분산을 줄이기 위해 정규화된 무작위 푸리에 기저(NRFF)를 소개하고, 효율적이고 낮은 분산의 커널 선형화를 위한 일반화된 최소-최대(GMM) 커널과 일반화된 일관된 가중 샘플링(GCWS)을 제안한다. GCWS는 더 적은 샘플로 NRFF보다 분류 정확도에서 뛰어나며, 훈련, 저장, 전송 비용이 낮아 대규모 학습에 더 실용적이다.

ABSTRACT

The method of "random Fourier features (RFF)" has become a popular tool for approximating the "radial basis function (RBF)" kernel. The variance of RFF is actually large. Interestingly, the variance can be substantially reduced by a simple normalization step as we theoretically demonstrate. We name the improved scheme as the "normalized RFF (NRFF)". We also propose the "generalized min-max (GMM)" kernel as a measure of data similarity. GMM is positive definite as there is an associated hashing method named "generalized consistent weighted sampling (GCWS)" which linearizes this nonlinear kernel. We provide an extensive empirical evaluation of the RBF kernel and the GMM kernel on more than 50 publicly available datasets. For a majority of the datasets, the (tuning-free) GMM kernel outperforms the best-tuned RBF kernel. We conduct extensive experiments for comparing the linearized RBF kernel using NRFF with the linearized GMM kernel using GCWS. We observe that, to reach a comparable classification accuracy, GCWS typically requires substantially fewer samples than NRFF, even on datasets where the original RBF kernel outperforms the original GMM kernel. The empirical success of GCWS (compared to NRFF) can also be explained from a theoretical perspective. Firstly, the relative variance (normalized by the squared expectation) of GCWS is substantially smaller than that of NRFF, except for the very high similarity region (where the variances of both methods are close to zero). Secondly, if we make a model assumption on the data, we can show analytically that GCWS exhibits much smaller variance than NRFF for estimating the same object (e.g., the RBF kernel), except for the very high similarity region.

연구 동기 및 목표

  • 표준 무작위 푸리에 기저(RFF)가 RBF 커널을 근사할 때 내재된 높은 분산을 줄이기 위해.
  • 데이터의 비선형성을 효과적으로 포착하고 양수 및 음수 값을 모두 지원하는 새로운 유사도 측정법인 일반화된 최소-최대(GMM) 커널을 제안하기 위해.
  • GMM 커널을 낮은 추정 분산으로 선형화하는 해싱 방법인 일반화된 일관된 가중 샘플링(GCWS)을 개발하기 위해.
  • 대규모 학습에서 샘플 효율성과 정확도 측면에서 GCWS와 NRFF를 이론적·실험적으로 비교하기 위해.
  • GCWS가 NRFF보다 더 적은 샘플로도 뛰어난 성능을 내며, 계산 및 저장 비용을 줄일 수 있음을 보여주기 위해.

제안 방법

  • 표준 RFF에 정규화 단계를 적용하여 RBF 커널 근사에서 분산을 줄이는 정규화된 무작위 푸리에 기저(NRFF)를 제안한다.
  • 기본값 기반 분할을 통해 데이터를 비음수 벡터로 변환하고, 변환된 차원에서 최소값의 합을 최대값의 합으로 나눈 비율로 유사도를 계산하는 일반화된 최소-최대(GMM) 커널을 도입한다.
  • GMM 커널을 선형화하기 위한 해싱 방법으로 일반화된 일관된 가중 샘플링(GCWS)을 개발하여, 변환된 데이터의 가중 샘플링에서 이산 해시 값을 생성한다.
  • 이론적 분석을 통해 GCWS가 NRFF보다 상대 분산이 훨씬 낮음을 보여주며, 높은 유사도 영역에서는 둘 다 분산이 0에 수렴하므로 예외이다.
  • 유연한 모델 가정을 도입하여, 동일한 커널 객체를 추정할 때 GCWS가 NRFF보다 훨씬 작은 분산을 가짐을 분석적으로 입증한다.
  • 선형 분류기(LIBLINEAR 등)를 사용하여 50개 이상의 공개 데이터셋에서 광범위한 실험을 수행하여, 동일한 조건에서 GCWS와 NRFF의 성능을 비교 검증한다.

실험 결과

연구 질문

  • RQ1간단한 정규화 단계가 RBF 커널 근사에서 무작위 푸리에 기저의 분산을 크게 줄일 수 있는가?
  • RQ2양수 및 음수 데이터를 모두 처리할 수 있는 일반화된 최소-최대(GMM) 커널이 RBF 커널보다 더 효과적인 유사도 측정법인가?
  • RQ3GCWS가 NRFF보다 훨씬 낮은 추정 분산으로 GMM 커널을 선형화할 수 있는가?
  • RQ4실제 데이터셋에서 동일한 분류 정확도를 달성하기 위해 GCWS가 필요한 샘플 수는 NRFF보다 얼마나 적은가?
  • RQ5GCWS의 이론적 분산 우수성은 다양한 데이터셋에서 실험적으로 검증될 수 있는가?

주요 결과

  • 이론적으로 증명되고 시뮬레이션으로 검증된 바에 따르면, NRFF는 표준 RFF보다 RBF 커널 근사에서 분산을 줄인다.
  • 시험한 50개 이상의 데이터셋 대부분에서, 조정이 필요 없는 GMM 커널이 최적 조정을 거친 RBF 커널보다 분류 정확도에서 뛰어나다.
  • 원래 RBF 커널이 원래 GMM 커널보다 성능이 뛰어나도, GCWS는 비교적 훨씬 적은 샘플로 동일한 분류 정확도를 달성한다.
  • 훈련, 저장, 전송 비용은 각 데이터 벡터의 비제로 요소 수에 비례한다; GCWS는 더 낮은 샘플 크기로 더 높은 정확도를 달성하여 이러한 비용을 크게 줄인다.
  • 대부분의 유사도 영역에서 GCWS는 NRFF보다 훨씬 낮은 상대 분산을 가지며, 이는 그 우수한 실험적 성능을 설명한다.
  • GCWS는 이산 해시 값을 자연스럽게 생성하므로, NRFF나 Nystrom 기반 방법과 달리 효율적인 근접 이웃 검색에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.