Skip to main content
QUICK REVIEW

[論文レビュー] Manifolds' Projective Approximation Using The Moving Least-Squares (MMLS).

Barak Sober, David Levin|arXiv (Cornell University)|Jun 22, 2016
Face and Expression Recognition参考文献 19被引用数 3
ひとこと要約

本稿では、ノイズが混入した散乱データ点から、高次元空間 R^n に埋め込まれた滑らかな d 次元部分多様体を近似するため、非線形な移動最小二乗法(MMLS)を提案する。移動最小二乗フレームワークを用いてデータを局所多項式近似に射影することで、無限に滑らかで、近似精度が O(h^{m+1}) の高次に達する。計算コストは n に対して線形であり、多様体の解析的表現を事前に知らなくてもよい。

ABSTRACT

In order to avoid the curse of dimensionality, frequently encountered in Big Data analysis, there was a vast development in the field of linear and non-linear dimension reduction techniques in recent years. These techniques (sometimes referred to as manifold learning) assume that the scattered input data is lying on a lower dimensional manifold, thus the high dimensionality problem can be overcome by learning the lower dimensionality behavior. However, in real life applications, data is often very noisy. In this work, we propose a method to approximate a $d$-dimensional $C^{m+1}$ smooth submanifold $\mathcal{M}$ residing in $\mathbb{R}^n$ ($d << n$) based upon scattered data points (i.e., a data cloud). We assume that the data points are located near the noisy lower dimensional manifold and perform a non-linear moving least-squares projection on an approximating manifold. Under some mild assumptions, the resulting approximant is shown to be infinitely smooth and of high approximation order (i.e., $O(h^{m+1})$, where $h$ is the fill distance and $m$ is the degree of the local polynomial approximation). Furthermore, the method presented here assumes no analytic knowledge of the approximated manifold and the approximation algorithm is linear in the large dimension $n$.

研究の動機と目的

  • 高次元データが低次元多様体上に分布する場合の次元の呪いを軽減するため、その近似を試みる。
  • 多様体学習において、従来の手法が滑らかさの欠如やノイズへの感受性により失敗する可能性がある現実世界のノイズ混入データを扱う。
  • 無限に滑らかで、高次の近似精度を持ち、高次元入力空間において計算的に効率的な手法を開発する。
  • 多様体の解析的表現を事前に必要としない非パラメトリックな近似フレームワークを提供する。

提案手法

  • 本手法は、多様体上の局所多項式近似に散乱データ点を射影するため、移動最小二乗(MLS)フレームワークを用いる。
  • 各データ点の周囲で、重み付き最小二乗法を用いて、次数 m の局所多項式近似を構築する。このとき、重み付き残差平方和を最小化する。
  • 距離に応じて重みが減少するように設定された重み関数を用いて、データ点と多項式面との間の誤差を最小化する局所最適化問題を解く。
  • 局所フィッティングに用いる滑らかな重み関数と多項式基底のおかげで、得られる近似は C∞ に滑らかであることが示される。
  • 本手法は、環境となる高次元空間 R^n 内で動作し、計算コストは n に対して線形であるため、大規模な次元に対してもスケーラブルである。
  • 多様体の解析的表現は必要とせず、散乱データクラウドと局所的な幾何的構造のみに依存する。

実験結果

リサーチクエスチョン

  • RQ1多様体の解析的表現を事前に知らなくても、ノイズ混入の散乱データから非線形で高次の多様体近似が可能か?
  • RQ2提案された MMLS を用いた手法の近似次数は何か? また、充填距離 h と多項式次数 m にどのように依存するか?
  • RQ3高次元データにおけるノイズや非一様なサンプリングがあっても、なぜ無限に滑らかさを保てるのか?
  • RQ4高次元入力空間において、近似精度を高く保ちながら計算コストを n に対して線形に保てるか?
  • RQ5データ分布と多様体の滑らかさに関する弱い仮定のもとで、収束性と安定性はどのように保証されるか?

主な発見

  • 提案された MMLS 近似は、局所近似に用いる重み関数と多項式基底の滑らかさのおかげで、無限に滑らか(C∞)である。
  • 本手法は、充填距離 h と局所多項式近似の次数 m に依存する近似次数 O(h^{m+1}) を達成する。
  • アルゴリズムの計算コストは環境次元 n に対して線形に増加し、高次元データへのスケーラビリティを実現する。
  • 下位多様体の解析的表現を一切必要としないため、現実世界のノイズ混入データへの応用に適している。
  • データ分布と多様体の滑らかさに関する弱い仮定のもとで、ノイズが存在しても安定的かつ高精度な多様体近似が可能である。
  • 本手法は、データ多様体の内在次元が低いことを利用することで、次元の呪いを効果的に軽減する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。