Skip to main content
QUICK REVIEW

[논문 리뷰] A General Scoring Rule for Randomized Kernel Approximation with Application to Canonical Correlation Analysis

Yinsong Wang, Shahin Shahrampour|arXiv (Cornell University)|2019. 10. 11.
Gaussian Processes and Bayesian Inference참고 문헌 32인용 수 4
한 줄 요약

이 논문은 다양한 기계학습 작업에서 커널 근사치를 향상시키는 데이터에 의존하는 랜덤 특징 샘플링을 위한 일반적인 스코어링 규칙을 제안한다. 특히 정준상관계분석(cca)에 중점을 두고 있다. 특징 샘플링을 위한 원칙적인 분포를 유도함으로써 정준상관계수를 최대화하고, 기존 기법들보다 cca 실험에서 뛰어난 성능을 보이며, 리지드 스코어링과 에너지 기반 샘플링과 같은 기존 기법들을 복원한다.

ABSTRACT

Random features has been widely used for kernel approximation in large-scale machine learning. A number of recent studies have explored data-dependent sampling of features, modifying the stochastic oracle from which random features are sampled. While proposed techniques in this realm improve the approximation, their application is limited to a specific learning task. In this paper, we propose a general scoring rule for sampling random features, which can be employed for various applications with some adjustments. We first observe that our method can recover a number of data-dependent sampling methods (e.g., leverage scores and energy-based sampling). Then, we restrict our attention to a ubiquitous problem in statistics and machine learning, namely Canonical Correlation Analysis (CCA). We provide a principled guide for finding the distribution maximizing the canonical correlations, resulting in a novel data-dependent method for sampling features. Numerical experiments verify that our algorithm consistently outperforms other sampling techniques in the CCA task.

연구 동기 및 목표

  • 다양한 기계학습 작업에 적용 가능한 일반적인 스코어링 규칙을 개발하는 것.
  • cca에서 정준상관계수를 최대화하는 데 최적화된 샘플링 분포를 원칙적으로 제공하는 방법을 마련하는 것.
  • 리지드 스코어링과 에너지 기반 샘플링과 같은 기존의 데이터에 의존하는 샘플링 기법들을 통합하고 일반화하는 것.
  • 특징 샘플링 분포를 최적화하여 대규모 cca에서 커널 근사치 정확도를 향상시키는 것.
  • cca 작업에 대한 수치 실험을 통해 제안된 방법의 우수성을 검증하는 것.

제안 방법

  • 저자들은 데이터 구조에 기반하여 최적의 샘플링 확률를 결정하는 일반적인 스코어링 규칙을 유도한다.
  • 이 방법은 cca에서 기대 정준상관계수를 최대화하는 특징에 대한 분포를 설정한다.
  • 제안된 스코어링 프레임워크 내에서 기존의 샘플링 전략들을 특수한 경우로 통합함으로써 이를 일반화한다.
  • 기대 상관계수 간의 최대화를 위해 변분 최적화 접근법을 사용하여 스코어링 규칙을 유도한다.
  • 특징이 정준상관계수에 더 기여할수록 높은 확률을 할당함으로써 효율적인 샘플링을 가능하게 한다.
  • 스코어 함수를 약간 수정함으로써 이 방법은 다른 커널 기반 방법들에도 적응 가능하다.

실험 결과

연구 질문

  • RQ1다양한 기계학습 작업에서 랜덤 특징 샘플링을 향상시키기 위한 일반적인 스코어링 규칙를 어떻게 설계할 수 있는가?
  • RQ2제안된 방법이 리지드 스코어링과 에너지 기반 샘플링과 같은 알려진 데이터에 의존하는 샘플링 기법들을 복원할 수 있는가?
  • RQ3cca에서 정준상관계수를 최대화하기 위한 최적의 샘플링 분포는 무엇인가?
  • RQ4제안된 방법은 cca에서 기존의 샘플링 전략들과 비교하여 성능 면에서 어떻게 다른가?
  • RQ5일반적인 스코어링 규칙는 대규모 환경에서 커널 근사치 정확도를 어느 정도 향상시키는가?

주요 결과

  • 제안된 스코어링 규칙는 리지드 스코어링과 에너지 기반 샘플링과 같은 기존의 데이터에 의존하는 샘플링 기법들을 특수한 경우로 복원한다.
  • cca 실험에서 기준 샘플링 기법들보다 높은 정준상관계수 값을 달성한다.
  • 수치 결과는 다양한 데이터셋과 설정에서 일관된 성능 향상을 보여준다.
  • 이 방법은 cca를 넘어서 다른 커널 방법으로도 확장 가능한 원칙적이고 통합된 특징 샘플링 프레임워크를 제공한다.
  • 일반적인 스코어링 규칙는 목표 작업에서 상관계수를 가장 크게 향상시키는 특징에 집중함으로써 더 정확한 커널 근사치를 가능하게 한다.
  • 이 알고리즘은 대규모 학습 시나리오에서 강인성과 확장성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.