Skip to main content
QUICK REVIEW

[論文レビュー] Noise-Tolerant Life-Long Matrix Completion via Adaptive Sampling

Maria-Florina Balcan, Hongyang Zhang|arXiv (Cornell University)|Dec 1, 2016
Sparse and Compressive Sensing Techniques被引用数 14
ひとこと要約

本稿では、ノイズ耐性のある生涯にわたる行列補完のための適応的サンプリングアルゴリズムを提案し、有界な決定的ノイズおよびスパースなランダムノイズモデル下で、近似的に最適なサンプル複雑度を達成する。有界なノイズ下では低誤差回復の確実な保証を提供し、スパースなランダムノイズ下では高確率で正確な回復を実現し、既知の下界に一致する。さらに、混合部分空間設定へと拡張され、サンプル効率が向上する。

ABSTRACT

We study the problem of recovering an incomplete $m imes n$ matrix of rank $r$ with columns arriving online over time. This is known as the problem of life-long matrix completion, and is widely applied to recommendation system, computer vision, system identification, etc. The challenge is to design provable algorithms tolerant to a large amount of noises, with small sample complexity. In this work, we give algorithms achieving strong guarantee under two realistic noise models. In bounded deterministic noise, an adversary can add any bounded yet unstructured noise to each column. For this problem, we present an algorithm that returns a matrix of a small error, with sample complexity almost as small as the best prior results in the noiseless case. For sparse random noise, where the corrupted columns are sparse and drawn randomly, we give an algorithm that exactly recovers an $μ_0$-incoherent matrix by probability at least $1-δ$ with sample complexity as small as $O\left(μ_0rn\log (r/δ) ight)$. This result advances the state-of-the-art work and matches the lower bound in a worst case. We also study the scenario where the hidden matrix lies on a mixture of subspaces and show that the sample complexity can be even smaller. Our proposed algorithms perform well experimentally in both synthetic and real-world datasets.

研究の動機と目的

  • 現実的で、特に有界な決定的ノイズおよびスパースなランダムノイズを含むノイズモデル下で、証明可能に頑健な生涯にわたる行列補完のためのアルゴリズムを設計すること。
  • ノイズが存在する中で、低ランク行列の正確な回復を保証しつつ、サンプル複雑度を最小限に抑えること。
  • 理論的保証を、元の行列が複数の部分空間の混合にあるような設定へと拡張し、さらに低いサンプル複雑度を実現すること。
  • 合成データおよび実世界のデータセット(ホプキンス155モーショングラフセグメンテーションデータセットを含む)上で、提案されたアルゴリズムの実験的検証を行うこと。

提案手法

  • ノイズ下での推定精度を向上させるために、情報量の多い列を段階的に選択する適応的サンプリングが用いられる。
  • 有界な決定的ノイズの場合、投影に基づく更新と誤差制御を用いて、列空間のロバストな推定を維持する。
  • スパースなランダムノイズの場合、汚染された列のスパarsityを活用し、核ノルム最小化と適応的サンプリングを組み合わせることで、正確な回復を保証する。
  • 理論的分析により、誤差がノイズレベルと不整合性の関数として境界づけられ、サンプル複雑度がノイズなしの場合に近いことが示される。
  • 新たな部分空間推定技術が、ノイズのある観測下でも真の列空間を追跡可能にし、収束保証が与えられる。
  • データが複数の低次元部分空間に存在するとモデル化することで、混合部分空間への拡張がなされ、サンプル複雑度の低減が可能になる。

実験結果

リサーチクエスチョン

  • RQ1適応的サンプリングは、有界な決定的ノイズ下で、生涯にわたる行列補完において近似的に最適なサンプル複雑度を達成できるか?
  • RQ2提案手法は、スパースなランダムノイズ下で、高確率で元の行列を正確に回復できるか?
  • RQ3元の行列が単一の部分空間ではなく複数の部分空間の混合にある場合、サンプル複雑度は単一部分空間の場合と比べてどのようにスケーリングされるか?
  • RQ4合成データおよび実世界の設定において、被動的サンプリングおよび先行手法を上回る性能を示せるか?
  • RQ5スパースなランダムノイズ下での正確な回復のための理論的サンプル複雑度の下界は何か? そして、提案手法はその下界に一致するか?

主な発見

  • 有界な決定的ノイズ下では、ノイズレベルが小さい限り、最小の出力誤差を達成し、サンプル複雑度が既存の最良のノイズなし結果にほぼ一致する。
  • スパースなランダムノイズ下では、μ₀不整合性を持つ行列を確率1−δ以上で正確に回復可能であり、サンプル複雑度はO(μ₀rn log(r/δ))に抑えられ、最悪ケースで情報理論的下界に一致する。
  • フェーズ遷移実験により、提案手法の成功領域は、被動的サンプリングおよび先行手法を厳密に上回っていることが実証された。
  • 混合部分空間設定下では、正確な回復に必要なサンプル複雑度が単一部分空間の場合よりも顕著に低くなる。
  • 合成データおよび実世界のデータセット(ホプキンス155を含む)における実験結果から、中程度のサンプリングレートでも相対誤差が10⁻³未満に保たれ、高い精度が達成された。
  • スパースなランダムノイズ下でのアルゴリズムのフェーズ遷移は、rおよびdに関してほぼ線形であり、理論的予測d = Ω(μ₀r log(r/δ))(δが小さい場合)と整合的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。