Skip to main content
QUICK REVIEW

[논문 리뷰] Manifolds' Projective Approximation Using The Moving Least-Squares (MMLS).

Barak Sober, David Levin|arXiv (Cornell University)|2016. 06. 22.
Face and Expression Recognition참고 문헌 19인용 수 3
한 줄 요약

이 논문은 높은 차원 공간 R^n에 임bed된 매끄럽고 d차원의 부분다양체를 노이즈가 섞인 산점 데이터로부터 비선형 이동 최소제곱(MMLS) 방법을 제안한다. 이동 최소제곱 프레임워크를 사용하여 데이터를 국소 다항식 근사에 투영함으로써, 해석적 형태를 사전에 알 필요 없이도 무한한 매끄러움과 고차수 근사 순서 O(h^{m+1})를 달성하며, 계산 비용은 n에 대해 선형이다.

ABSTRACT

In order to avoid the curse of dimensionality, frequently encountered in Big Data analysis, there was a vast development in the field of linear and non-linear dimension reduction techniques in recent years. These techniques (sometimes referred to as manifold learning) assume that the scattered input data is lying on a lower dimensional manifold, thus the high dimensionality problem can be overcome by learning the lower dimensionality behavior. However, in real life applications, data is often very noisy. In this work, we propose a method to approximate a $d$-dimensional $C^{m+1}$ smooth submanifold $\mathcal{M}$ residing in $\mathbb{R}^n$ ($d << n$) based upon scattered data points (i.e., a data cloud). We assume that the data points are located near the noisy lower dimensional manifold and perform a non-linear moving least-squares projection on an approximating manifold. Under some mild assumptions, the resulting approximant is shown to be infinitely smooth and of high approximation order (i.e., $O(h^{m+1})$, where $h$ is the fill distance and $m$ is the degree of the local polynomial approximation). Furthermore, the method presented here assumes no analytic knowledge of the approximated manifold and the approximation algorithm is linear in the large dimension $n$.

연구 동기 및 목표

  • 빅데이터에서 차원의 종말 문제를 해결하기 위해, 낮은 차원의 다양체 위에 놓인 고차원 데이터를 근사하고자 한다.
  • 기존 방법이 매끄럽지 않거나 노이즈에 민감하여 실패할 수 있는 실제 세계의 노이즈가 섞인 데이터를 다룰 수 있도록 하고자 한다.
  • 무한한 매끄러움, 높은 근사 순서, 고차원 입력 공간에서의 계산 효율성을 갖춘 방법을 개발하고자 한다.
  • 다양체의 해석적 형태에 대한 사전 지식이 필요 없는 비모수적 근사 프레임워크를 제공하고자 한다.

제안 방법

  • 이 방법은 산점 데이터 포인트를 다양체 위의 국소 다항식 근사에 투영하기 위해 이동 최소제곱(MLS) 프레임워크를 사용한다.
  • 거리에 따라 감쇠하는 가중치를 사용하여 각 데이터 포인트 주변에서 차수 m의 국소 다항식 근사를 구성하며, 가중 최소제곱을 최소화한다.
  • 데이터 포인트와 다항식 표면 사이의 오차를 최소화하는 국소 최적화 문제를 풀어 근사를 수행하며, 가중치는 거리가 멀수록 감소한다.
  • 국소 피팅에 사용된 매끄러운 가중치 함수와 다항식 기저 덕분에 결과 근사식은 C∞ 매끄럽다.
  • 알고리즘은 맹글링 고차원 공간 R^n에서 작동하며, 계산 비용은 n에 대해 선형이므로 큰 차원에 대해서도 확장 가능하다.
  • 다양체의 해석적 표현이 필요 없으며, 방법은 산점 데이터 클러스터와 국소 기하학적 구조에만 의존한다.

실험 결과

연구 질문

  • RQ1해석적 형태를 사전에 알지 못한 채 노이즈가 섞인 산점 데이터로부터 비선형적이고 고차수의 매끄러운 다양체 근사를 달성할 수 있는가?
  • RQ2제안된 MMLS 기반 방법의 근사 순서는 무엇이며, 이를 결정하는 요소인 충진 거리 h와 다항식 차수 m에 따라 어떻게 달라지는가?
  • RQ3노이즈와 비균일 샘플링이 있는 고차원 데이터에서, 이 방법은 어떻게 무한한 매끄러움을 유지할 수 있는가?
  • RQ4고차원 입력 공간에서 높은 근사 정확도를 달성하면서도 계산 비용이 맹글링 차원 n에 대해 선형으로 유지될 수 있는가?
  • RQ5데이터 분포와 다양체의 매끄러움에 대한 온건한 가정 하에, 이 방법은 수렴성과 안정성 측면에서 어떻게 성능을 발휘하는가?

주요 결과

  • 제안된 MMLS 근사식은 국소 근사에 사용된 가중치 함수와 다항식 기저의 매끄러움 덕분에 무한히 매끄럽다(C∞).
  • 이 방법은 충진 거리 h와 국소 다항식 근사의 차수 m에 대해 고차수 근사 순서 O(h^{m+1})를 달성한다.
  • 알고리즘의 계산 비용은 맹글링 차원 n에 대해 선형으로 증가하므로 고차원 데이터에 대한 확장성이 보장된다.
  • 기본 다양체의 해석적 지식이 필요 없기 때문에 실제 노이즈가 섞인 데이터 응용에 적합하다.
  • 데이터 분포와 다양체의 매끄러움에 대한 온건한 가정 하에, 노이즈가 존재하더라도 안정적이고 정확한 다양체 근사를 제공한다.
  • 이 방법은 데이터 다양체의 낮은 내재 차원성을 활용함으로써 차원의 종말 문제를 효과적으로 완화한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.