Skip to main content
QUICK REVIEW

[論文レビュー] A General Scoring Rule for Randomized Kernel Approximation with Application to Canonical Correlation Analysis

Yinsong Wang, Shahin Shahrampour|arXiv (Cornell University)|Oct 11, 2019
Gaussian Processes and Bayesian Inference参考文献 32被引用数 4
ひとこと要約

本稿では、多様な機械学習タスクにおいてカーネル近似を向上させる、データに依存するランダム特徴量サンプリングの一般化スコアルールを提案する。主な焦点は、線形相関分析(CCA)に向けたものである。特徴量のサンプリングに適した原理的で一貫した分布を導出することで、Canonical Correlation Analysis(CCA)の実験において、既存の手法を上回る性能を発揮するとともに、リッジスコアやエネルギーベースのサンプリングといった既知の手法を回復する。

ABSTRACT

Random features has been widely used for kernel approximation in large-scale machine learning. A number of recent studies have explored data-dependent sampling of features, modifying the stochastic oracle from which random features are sampled. While proposed techniques in this realm improve the approximation, their application is limited to a specific learning task. In this paper, we propose a general scoring rule for sampling random features, which can be employed for various applications with some adjustments. We first observe that our method can recover a number of data-dependent sampling methods (e.g., leverage scores and energy-based sampling). Then, we restrict our attention to a ubiquitous problem in statistics and machine learning, namely Canonical Correlation Analysis (CCA). We provide a principled guide for finding the distribution maximizing the canonical correlations, resulting in a novel data-dependent method for sampling features. Numerical experiments verify that our algorithm consistently outperforms other sampling techniques in the CCA task.

研究の動機と目的

  • 複数の機械学習タスクに適用可能な一般化スコアルールの開発を目的とする。
  • CCAにおける線形相関を最大化するための、原理的で一貫したサンプリング分布の選択法を提供することを目的とする。
  • リッジスコアやエネルギーベースのサンプリングといった、既存のデータに依存するサンプリング手法を統合・一般化することを目的とする。
  • 特徴量のサンプリング分布を最適化することで、大規模なCCAにおけるカーネル近似の精度を向上させることを目的とする。
  • CCAタスクにおける数値実験を通じて、本手法の優位性を検証することを目的とする。

提案手法

  • 著者らは、データ構造に基づいて最適なサンプリング確率を決定する一般化スコアルールを導出する。
  • 本手法は、CCAにおける期待される線形相関を最大化するように、特徴量の分布を定式化する。
  • 提案されたスコアフレームワーク内に既存のサンプリング戦略を特別なケースとして統合することで、それらを一般化する。
  • 期待される相関の最大化を目的とした変分最適化アプローチを用いて、スコアルールを導出する。
  • 特徴量が線形相関に寄与する程度に応じて、高い確率でサンプリングされるように効率的なサンプリングを可能にする。
  • スコア関数のわずかな調整により、他のカーネルベースの手法へも適応可能である。

実験結果

リサーチクエスチョン

  • RQ1多様な機械学習タスクにおいて、ランダム特徴量サンプリングを改善する一般化スコアルールをどのように設計できるか?
  • RQ2提案手法は、リッジスコアやエネルギーベースのサンプリングといった既知のデータに依存するサンプリング手法を回復できるか?
  • RQ3CCAにおける線形相関を最大化するための最適なサンプリング分布は何か?
  • RQ4提案手法は、CCAにおける既存のサンプリング戦略と比較して、性能で優れているか?
  • RQ5一般化スコアルールは、大規模な設定において、どの程度カーネル近似の精度を向上させるか?

主な発見

  • 提案されたスコアルールは、リッジスコアやエネルギーベースのサンプリングといった既存のデータに依存するサンプリング手法を特別なケースとして回復する。
  • CCAの実験において、ベースラインのサンプリング手法よりも高い線形相関値を達成する。
  • 数値結果から、複数のデータセットや設定において一貫した性能向上が確認された。
  • 本手法は、CCAを越えて他のカーネル法へも拡張可能な、原理的で統一的な特徴量サンプリングフレームワークを提供する。
  • 本一般化スコアルールにより、ターゲットタスクにおける相関向上に寄与する特徴量に焦点を当てた、より正確なカーネル近似が可能になる。
  • アルゴリズムは、大規模な学習シナリオにおいて、頑健性とスケーラビリティを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。