Skip to main content
QUICK REVIEW

[论文解读] Manifolds' Projective Approximation Using The Moving Least-Squares (MMLS).

Barak Sober, David Levin|arXiv (Cornell University)|Jun 22, 2016
Face and Expression Recognition参考文献 19被引用 3
一句话总结

本文提出一种非线性移动最小二乘法(MMLS),用于从高维空间 R^n 中的噪声散乱数据点近似光滑的 d 维子流形。通过在移动最小二乘框架下将数据投影到局部多项式逼近上,该方法实现了无穷光滑性及高阶逼近精度 O(h^{m+1}),且计算成本在 n 上线性增长,即使在缺乏流形解析形式先验知识的情况下亦成立。

ABSTRACT

In order to avoid the curse of dimensionality, frequently encountered in Big Data analysis, there was a vast development in the field of linear and non-linear dimension reduction techniques in recent years. These techniques (sometimes referred to as manifold learning) assume that the scattered input data is lying on a lower dimensional manifold, thus the high dimensionality problem can be overcome by learning the lower dimensionality behavior. However, in real life applications, data is often very noisy. In this work, we propose a method to approximate a $d$-dimensional $C^{m+1}$ smooth submanifold $\mathcal{M}$ residing in $\mathbb{R}^n$ ($d << n$) based upon scattered data points (i.e., a data cloud). We assume that the data points are located near the noisy lower dimensional manifold and perform a non-linear moving least-squares projection on an approximating manifold. Under some mild assumptions, the resulting approximant is shown to be infinitely smooth and of high approximation order (i.e., $O(h^{m+1})$, where $h$ is the fill distance and $m$ is the degree of the local polynomial approximation). Furthermore, the method presented here assumes no analytic knowledge of the approximated manifold and the approximation algorithm is linear in the large dimension $n$.

研究动机与目标

  • 通过近似位于低维流形上的高维数据,解决大数据中的维度灾难问题。
  • 处理流形学习中真实世界中的噪声数据,传统方法可能因缺乏光滑性或对噪声敏感而失效。
  • 开发一种具有无穷光滑性、高逼近阶数且在高维输入空间中计算高效的算法。
  • 提供一种非参数逼近框架,无需事先了解流形的解析形式。

提出的方法

  • 该方法使用移动最小二乘(MLS)框架,将散乱数据点投影到流形上的局部多项式逼近上。
  • 通过加权最小二乘法,在每个数据点周围构造一个 m 次局部多项式逼近,最小化加权残差平方和。
  • 通过求解一个局部优化问题来实现逼近,该问题最小化数据点与多项式曲面之间的误差,权重随距离衰减。
  • 由于局部拟合中使用的光滑权重函数和多项式基,所得逼近器被证明是 C∞ 光滑的。
  • 该方法在环境高维空间 R^n 中运行,计算成本在 n 上线性,因此可扩展至大维度。
  • 无需流形的解析表达式;该方法仅依赖于散乱数据点云和局部几何结构。

实验结果

研究问题

  • RQ1能否在不依赖流形解析形式先验知识的情况下,从噪声散乱数据中实现光滑流形的非线性高阶逼近?
  • RQ2所提出的基于 MMLS 的方法的逼近阶是多少?其如何依赖于填充距离 h 和多项式次数 m?
  • RQ3该方法如何在高维数据存在噪声和非均匀采样时仍保持无穷光滑性?
  • RQ4在保持高逼近精度的同时,计算成本能否在环境维度 n 上保持线性?
  • RQ5在数据分布和流形光滑性满足弱假设条件下,该方法在收敛性和稳定性方面表现如何?

主要发现

  • 所提出的 MMLS 逼近器由于局部逼近中权重函数和多项式基的光滑性,具有无穷光滑性(C∞)。
  • 该方法实现了高阶逼近精度 O(h^{m+1}),其中 h 为填充距离,m 为局部多项式逼近的次数。
  • 该算法的计算成本随环境维度 n 线性增长,使其可扩展至高维数据。
  • 该方法无需任何关于底层流形的解析知识,因此适用于真实世界噪声数据的应用。
  • 在数据分布和流形光滑性满足弱假设的条件下,该方法即使在存在噪声的情况下,也能提供稳定且准确的流形逼近。
  • 该方法通过利用数据流形的低内在维度,有效缓解了维度灾难。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。