Skip to main content
QUICK REVIEW

[論文レビュー] The Sample Complexity of Subspace Learning with Partial Information.

Alon Gonen, Dan Rosenbaum|arXiv (Cornell University)|Feb 19, 2014
Sparse and Compressive Sensing Techniques参考文献 19被引用数 3
ひとこと要約

本稿は、各インスタンスあたりr ≤ d個の属性のみが利用可能な部分的情報下での部分空間学習のサンプル複雑度を調査する。バンドイット問題におけるベクトルサンプリング技術の行列一般化を用いて、上界と下界を確立し、部分的観測下でのk次元部分空間の学習が、kとrに比例して効率的にスケーリングするサンプルサイズで可能であることを示している。dではなくkとrに依存する。

ABSTRACT

The goal of subspace learning is to find a $k$-dimensional subspace of $\mathbb{R}^d$, such that the expected squared distance between instance vectors and the subspace is as small as possible. In this paper we study the sample complexity of subspace learning in a \emph{partial information} setting, in which the learner can only observe $r \le d$ attributes from each instance vector. We derive upper and lower bounds on the sample complexity in different scenarios. In particular, our upper bounds involve a generalization of vector sampling techniques, which are often used in bandit problems, to matrices.

研究の動機と目的

  • 各インスタンスあたりr ≤ d個の属性しか観測されない状況における部分空間学習の根本的サンプル複雑度を理解すること。
  • 高次元空間における不完全なデータから低次元部分空間を学ぶという課題に取り組むこと。
  • 部分的情報下での正確な部分空間推定に必要なサンプル数を定量化する理論的境界を構築すること。
  • バンドイット問題におけるベクトルサンプリング技術を行列設定に一般化し、サンプル効率を向上させること。

提案手法

  • バンドイット学習で一般的に用いられるベクトルサンプリング技術の行列一般化を提唱し、部分的観測を伴う部分空間学習を処理する。
  • 部分的属性観測下でのデータベクトルと学習された部分空間間の期待二乗再構成誤差を分析する。
  • 確率的集中不等式およびランダム行列射影における行列チェルノフ型不等式を用いて、サンプル複雑度の上界を導出する。
  • 情報理論的議論を用いて下界を確立し、上界のタイトネスを示す。
  • r(観測された属性数)、k(部分空間次元)、d(埋め込み次元)の関係に基づく異なる状況を検討する。
  • マルチアームバンディットを想起させるフレームワークを用いるが、部分フィードバックをモデル化するため、行列値推定に拡張する。

実験結果

リサーチクエスチョン

  • RQ1各インスタンスあたりr個の属性しか観測されない状況で、k次元部分空間を学習するために必要な最小サンプル数は何か?
  • RQ2部分的情報設定下でのサンプル複雑度は、r、k、dのどのようになおるか?
  • RQ3バンドイット問題におけるベクトルサンプリング技術を、部分空間学習の行列推定に一般化できるか?
  • RQ4導出されたサンプル複雑度の上界はタイトであるか?それに対応する下界は何か?
  • RQ5部分的観測の構造は、部分空間学習の統計的効率にどのように影響するか?

主な発見

  • 部分的情報下での部分空間学習のサンプル複雑度は、kとrに依存するが、全埋め込み次元dには依存せず、高次元設定でも効率的であることを示している。
  • 新しい行列一般化されたベクトルサンプリング技術を用いて、部分的観測からの効率的学習を可能にするサンプル複雑度の上界が導出された。
  • 下界により、導出された上界が対数要因を除いてタイトであることが確認され、問題の根本的限界が確立された。
  • r ≪ dであっても、サンプル数がdに対して非線形的に増加する場合でも、正確な部分空間推定が可能であることが示された。
  • rがkに対して十分に大きい場合、部分フィードバックは完全情報設定と比較してサンプル複雑度を著しく悪化させないことがフレームワークによって示された。
  • 分析により、学習の有効次元はdではなく、rとkによって決定され、属性選択がサンプル複雑度の低減に果たす役割が浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。