Skip to main content
QUICK REVIEW

[論文レビュー] Approximate Sparse Linear Regression

Sariel Har-Peled, Piotr Indyk|arXiv (Cornell University)|Sep 28, 2016
Sparse and Compressive Sensing Techniques参考文献 3被引用数 4
ひとこと要約

本稿では、近似的最近傍(ANN)データ構造を用いて、近似的に最適に近いクエリ時間で達成可能なスパース線形回帰および関連する幾何学的問題に対する近似アルゴリズムを提示する。定数のスパarsity kに対して、eO(n^{k-1})のクエリ時間を達成し、アフィン的に退化する予想に基づく条件付き下界と一致する。また、機械学習やコンピュータビジョンにおける実用的意義を持つ、新しい幾何学的部分問題を導入する。

ABSTRACT

In the Sparse Linear Regression (SLR) problem, given a $d imes n$ matrix $M$ and a $d$-dimensional query $q$, the goal is to compute a $k$-sparse $n$-dimensional vector $τ$ such that the error $||M τ-q||$ is minimized. This problem is equivalent to the following geometric problem: given a set $P$ of $n$ points and a query point $q$ in $d$ dimensions, find the closest $k$-dimensional subspace to $q$, that is spanned by a subset of $k$ points in $P$. In this paper, we present data-structures/algorithms and conditional lower bounds for several variants of this problem (such as finding the closest induced $k$ dimensional flat/simplex instead of a subspace). In particular, we present approximation algorithms for the online variants of the above problems with query time $ ilde O(n^{k-1})$, which are of interest in the "low sparsity regime" where $k$ is small, e.g., $2$ or $3$. For $k=d$, this matches, up to polylogarithmic factors, the lower bound that relies on the affinely degenerate conjecture (i.e., deciding if $n$ points in $\mathbb{R}^d$ contains $d+1$ points contained in a hyperplane takes $Ω(n^d)$ time). Moreover, our algorithms involve formulating and solving several geometric subproblems, which we believe to be of independent interest.

研究の動機と目的

  • 低スパarsity kのオンライン/クエリ設定におけるスパース線形回帰(SLR)の計算複雑性に対処すること。
  • 保証付きの近似アルゴリズムを、SLR、アフィンSLR、凸SLRの変種に対して効率的に開発すること。
  • スパースモデリングに関連する、最近接の誘導されたk次元フラットやk単体を見つけるといった幾何学的部分問題を定式化し、解法を提示すること。
  • アフィン的に退化する予想に依存する条件付き下界を確立し、SLRアルゴリズムの改善限界を理解すること。
  • 幾何学的問題を近的最近傍クエリに還元するフレームワークを提供し、実用的導入を可能にすること。

提案手法

  • スパース線形回帰問題を幾何学的問題に還元:点集合Pに由来するk個の点によって誘導されるk次元フラットまたは単体の最近接点を求める。
  • 効率的なクエリデータ構造を構築するためのプリミティブとして、(1+ε)-近的最近傍(ANN)データ構造を用いる。
  • 各点c ∈ Pの周囲にスタア型のデータ構造を構築し、スパース表現に必要な候補点を捉える。
  • 再帰的コーンカットと距離解析を適用して近似誤差を制限し、幾何的制約下で(1+ε)-近似を保証する。
  • ANN距離が小さい場合には標準的なANNクエリで十分であり、それ以外の場合はコーンや球による幾何的プルーニングで誤差を有界に保つ。
  • 球やコーンなどのクリッピング済み点集合上で複数のANNクエリを組み合わせることで、完全なスパース回帰問題の挙動をシミュレートする。

実験結果

リサーチクエスチョン

  • RQ1高次元において定数のスパarsity kを持つスパース線形回帰に対して、サブ指数的クエリ時間は達成可能か?
  • RQ2SLRにおいて、近線形または近多項式的クエリ時間で達成可能な最良の近似係数は何か?
  • RQ3アフィン的に退化する予想に基づく条件付き下界は、SLRアルゴリズムの性能にどのように制限を加えるか?
  • RQ4最近接の誘導されたフラットや単体といった幾何学的部分問題は、有界なオーバーヘッドで近的最近傍クエリに還元可能か?
  • RQ5オンラインSLR設定において、空間、クエリ時間、近似品質のトレードオフは何か?

主な発見

  • k = 2の場合、最近接の誘導された線分問題に対して(2 + ε)-近似を、クエリ時間O(n log n + n/ε^d)で達成し、対数要因を除いて既知の下界と一致する。
  • 近的最近接の誘導された線分を求めるための提案アルゴリズムは、O(S(n, ε)n log n)の空間とO(TQ(n, ε)nε^{-2} log n)のクエリ時間を要する。ここでSとTQは、下位の(1+ε)-ANN構造の空間およびクエリ時間である。
  • 一般のkスパースケースでは、クエリ時間がeO(n^{k-1})であり、k = dのときアフィン的に退化する予想に基づく条件付き下界と一致する。
  • フレームワークは、SLR問題を、注意深く構築された点集合上での(1+ε/4)-ANNクエリの列に還元し、高確率で(1+ε)-近似を保証する。
  • 解析により、ANN距離が小さい(O(√ε r))場合には標準的なANNクエリで十分であり、それ以外の場合はコーンや球による幾何的プルーニングにより誤差が有界に保たれることが示された。
  • 本稿では、空間のオーバーヘッドがnの対数的要因にしかならず、低スパarsityのスケールの大きなデータに対して実用的であることが確立された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。