Skip to main content
QUICK REVIEW

[論文レビュー] A determinantal point process for column subset selection

Ayoub Belhadji, R. Bardenet|arXiv (Cornell University)|Dec 23, 2018
Stochastic Gradient Optimization Techniques参考文献 46被引用数 14
ひとこと要約

本稿では、行列 X から k 個の多様な列を選択するための新しい確率的列サブセット選択アルゴリズムを提案する。この手法は射影型定式化されたデターミナント点過程(DPP)を用い、高品質な低ランク近似を保証する。本手法は、k-レバレッジスコアのスパarsity または速やかな減衰といった現実的な構造的仮定のもとで、ボリュームサンプリングよりもタイトな理論的誤差バインディングを達成する。一方で、ダブルフェーズアルゴリズムの実験的性能と同等である。

ABSTRACT

Dimensionality reduction is a first step of many machine learning pipelines. Two popular approaches are principal component analysis, which projects onto a small number of well chosen but non-interpretable directions, and feature selection, which selects a small number of the original features. Feature selection can be abstracted as a numerical linear algebra problem called the column subset selection problem (CSSP). CSSP corresponds to selecting the best subset of columns of a matrix $X \in \mathbb{R}^{N imes d}$, where \emph{best} is often meant in the sense of minimizing the approximation error, i.e., the norm of the residual after projection of $X$ onto the space spanned by the selected columns. Such an optimization over subsets of $\{1,\dots,d\}$ is usually impractical. One workaround that has been vastly explored is to resort to polynomial-cost, random subset selection algorithms that favor small values of this approximation error. We propose such a randomized algorithm, based on sampling from a projection determinantal point process (DPP), a repulsive distribution over a fixed number $k$ of indices $\{1,\dots,d\}$ that favors diversity among the selected columns. We give bounds on the ratio of the expected approximation error for this DPP over the optimal error of PCA. These bounds improve over the state-of-the-art bounds of \emph{volume sampling} when some realistic structural assumptions are satisfied for $X$. Numerical experiments suggest that our bounds are tight, and that our algorithms have comparable performance with the \emph{double phase} algorithm, often considered to be the practical state-of-the-art. Column subset selection with DPPs thus inherits the best of both worlds: good empirical performance and tight error bounds.

研究の動機と目的

  • 高次元行列 X から解釈可能性を保ちつつ近似誤差を最小化する、少数で多様な列のサブセットを選択する課題に対処すること。
  • 計算効率と近似誤差に関する強い理論的保証の両立を図る、列サブセット選択(CSS)の確率的アルゴリズムを開発すること。
  • ボリュームサンプリングやダブルフェーズアルゴリズムといった既存手法を改善し、現実の行列構造を反映したタイトな理論的バインディングを提供すること。
  • 選択された列を特徴量として用いたスケッチド線形回帰における過剰リスクを分析し、レバレッジスコアのスパarsity とよりタイトな一般化バインディングの関係を明らかにすること。
  • 実験的に、DPP を用いた手法が、現在の実験的ゴールドスタンダードであるダブルフェーズアルゴリズムと同等の性能を示すことを検証すること。

提案手法

  • 本手法は、行列 X の最初の k 個の右特異ベクトル V_k を用いて定義されるカーネル行列 K = V_k V_k^T によってパrameter化された射影 DPP を用い、列選択における多様性を誘導する。
  • DPP からのサンプリングにより、選択された列が列空間内で広範な方向をカバーするようになり、冗長性が低減され、部分空間カバレッジが向上する。
  • 本手法は、列の重要度の代理として k-レバレッジスコアを用い、これらのスコアのスパarsity および減衰が理論的バインディングにおいて中心的な役割を果たす。
  • 理論的分析により、ランク-k PCA に対する近似誤差の期待値のフロベニウスノルムおよびスペクトルノルムに関する乗法的バインディングが得られる。
  • 本手法は、スケッチド線形回帰における過剰リスクの分析へと拡張され、k-レバレッジスコアのスパarsity がよりタイトなリスクバインディングをもたらすことが示された。
  • 数値実験では、合成データおよび実データセットを用い、固定およびブーストドサンプリング戦略を用いて、DPP を用いた手法とボリュームサンプリング、ダブルフェーズ、その他のベースラインとを比較した。

実験結果

リサーチクエスチョン

  • RQ1行列 X にどのような構造的条件下で、DPP を用いた列選択手法がボリュームサンプリングよりもタイトな理論的近似誤差バインディングを達成するか?
  • RQ2k-レバレッジスコアのスパarsity または減衰率は、提案された DPP を用いた列選択アルゴリズムの性能および理論的保証にどのように影響するか?
  • RQ3DPP を用いた列選択手法は、ダブルフェーズアルゴリズムと同等の実験的性能を達成しつつ、よりタイトな理論的バインディングを提供できるか?
  • RQ4k-レバレッジスコアのスパarsity と、選択された列を特徴量として用いた線形回帰における過剰リスクの関係は何か?
  • RQ5i.i.d. サンプリングやボリュームサンプリングと比較して、DPP サンプリング機構は多様性および近似誤差の観点でどのように異なるか?

主な発見

  • k-レバレッジスコアのスパarsity または速やかな減衰が成立する条件下で、DPP を用いた手法はボリュームサンプリングよりも、フロベニウスノルムおよびスペクトルノルムの両方において、期待近似誤差の理論的バインディングがタイトであることが示された。
  • k-レバレッジスコアがスパースまたは急速に減衰する場合、理論的バインディングが著しく改善され、圧縮センシングおよび行列近似分野での既存の知見と整合的である。
  • 数値実験では、DPP を用いた手法が、現在の実験的ゴールドスタンダードであるダブルフェーズアルゴリズムと、Relathe や Leukemia を含む複数のデータセットで同等の性能を示した。
  • スケッチド線形回帰における過剰リスクが、k-レバレッジスコアがスパースまたは速やかに減衰する場合に小さくなることが示され、本手法の下流学習タスクへの有用性が裏付けられた。
  • 本手法は、強い理論的保証と強い実験的性能を両立しており、解釈可能性と近似精度のバランスの取れたソリューションを提供する。
  • 理論的分析により、DPP サンプリング機構が、列が重複しているまたは相関が高い場合に、i.i.d. サンプリングやボリュームサンプリングよりも優れた部分空間カバレッジを実現することが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。