Skip to main content
QUICK REVIEW

[논문 리뷰] ManifoldNet: A Deep Network Framework for Manifold-valued Data

Rudrasis Chakraborty, Jose Bouza|arXiv (Cornell University)|2018. 09. 11.
Human Pose and Action Recognition참고 문헌 9인용 수 16
한 줄 요약

ManifoldNet은 표준 컨볼루션을 증명 가능하게 수렴하는 재귀적 가중 프리체트 평균(wFM) 레이어로 대체함으로써 다양체 값 데이터를 위한 딥러닝 프레임워크를 제안한다. 이는 등급변환군 작용에 대해 동치성을 유지하고, ReLU 또는 풀링 레이어의 필요성을 제거한다. 이 방법은 과적합을 줄이고 파rameter 효율성을 높이며, 비디오 분류 및 이미지 복원에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Deep neural networks have become the main work horse for many tasks involving learning from data in a variety of applications in Science and Engineering. Traditionally, the input to these networks lie in a vector space and the operations employed within the network are well defined on vector-spaces. In the recent past, due to technological advances in sensing, it has become possible to acquire manifold-valued data sets either directly or indirectly. Examples include but are not limited to data from omnidirectional cameras on automobiles, drones etc., synthetic aperture radar imaging, diffusion magnetic resonance imaging, elastography and conductance imaging in the Medical Imaging domain and others. Thus, there is need to generalize the deep neural networks to cope with input data that reside on curved manifolds where vector space operations are not naturally admissible. In this paper, we present a novel theoretical framework to generalize the widely popular convolutional neural networks (CNNs) to high dimensional manifold-valued data inputs. We call these networks, ManifoldNets. In ManifoldNets, convolution operation on data residing on Riemannian manifolds is achieved via a provably convergent recursive computation of the weighted Fréchet Mean (wFM) of the given data, where the weights makeup the convolution mask, to be learned. Further, we prove that the proposed wFM layer achieves a contraction mapping and hence ManifoldNet does not need the non-linear ReLU unit used in standard CNNs. We present experiments, using the ManifoldNet framework, to achieve dimensionality reduction by computing the principal linear subspaces that naturally reside on a Grassmannian. The experimental results demonstrate the efficacy of ManifoldNets in the context of classification and reconstruction accuracy.

연구 동기 및 목표

  • 대칭 양의 정합 행렬, 구면, 그라스만만과 같이 곡률이 있는 리만다이내어의 다각형에 존재하는 데이터를 위한 딥러닝 프레임워크의 부족을 해결하기 위해.
  • 벡터 공간 컨볼루션을 비유클리드 데이터에 적합한 내재적 연산으로 대체함으로써 컨volutional 신경망(CNNs)을 일반화하기 위해.
  • 다양체에서 가중 프리체트 평균 계산을 수행하는 레이어를 개발하여 수렴성과 등급변환군에 의한 가중치 공유를 가능하게 하기 위해.
  • wFM 연산의 본질적 풀링 성질을 활용하여 ReLU 및 풀링 레이어의 필요성을 제거하기 위해.
  • 자동에코더 아키텍처를 사용하여 비디오 분류 및 이미지 복원 작업에서 프레임워크의 유효성을 입증하기 위해.

제안 방법

  • 표준 선형 및 ReLU 연산을 대체하기 위해 다각형에 대한 컨볼루션의 유사체로 작용하는 가중 프리체트 평균(wFM) 기반의 새로운 네트워크 레이어를 제안한다.
  • 리만다이내어에서 안정적이고 효율적인 최적화를 보장하기 위해 wFM을 계산하기 위한 증명 가능한 수렴성 있는 재귀 알고리즘을 도입한다.
  • wFM 레이어가 기저 리만다이내어의 등급변환군 작용에 대해 동치성임을 증명하여 공간적 위치 간의 가중치 공유를 가능하게 한다.
  • 완전 연결 레이어를 대체하기 위해 wFM 레이어를 사용하는 다각형 인식 자동에코더+디코더 아키텍처를 설계하여 차원 감소 및 복원을 수행한다.
  • 다양체 값 데이터의 저차원 표현을 계산하기 위해 그라스만 평균과 iFME(반복 프리체트 평균 추정기) 레이어를 활용한다.
  • 모든 연산—예를 들어 평균 계산 및 레이어 전파—가 유클리드 공간으로의 임bedding 없이도 다각형의 구조 내에서 유지되도록 내재적 리만 기하학을 사용한다.

실험 결과

연구 질문

  • RQ1내재적 리만 기하 연산만을 사용하여 다각형 값 데이터를 처리할 수 있는 딥 네트워크를 일반화할 수 있는가?
  • RQ2가중 프리체트 평균 레이어가 표준 컨볼루션과 ReLU에 비해 안정적이고 수렴되며 동치성 있는 대안을 제공하는가?
  • RQ3wFM 레이어가 추가적인 풀링 또는 비선형 활성화 레이어가 필요 없이 자연스러운 풀링 연산으로 기능할 수 있는가?
  • RQ4ManifoldNet 프레임워크는 표준 자동에코더와 PCA에 비해 다각형 값 데이터의 복원 품질과 일반화 성능에서 어떻게 비교되는가?
  • RQ5다양체의 내재 기하학적 특성이 최종 작업에서 일반화 성능을 향상시키고 과적합을 줄이는 데 얼마나 기여하는가?

주요 결과

  • 제안된 ManifoldNet 프레임워크는 표준 완전 연결 자동에코더 대비 파rameter 수를 46% 감소시켰으며, 주로 큰 완전 연결 레이어를 그라스만 평균 레이어로 대체함으로써 달성되었다.
  • iFME+자동에코더 아키텍처는 표준 자동에코더보다 수렴 속도가 빠르며, 계산 시간을 줄이고 낮은 복원 오차를 달성한다. 이는 시간-오차 그래프(그림 4)에서 확인할 수 있다.
  • MNIST 데이터셋에서 ManifoldNet 기반 자동에코더+iFME는 재구성된 데이터에 분류기를 적용했을 때 테스트 세트 분류 정확도가 46.00%를 기록했으며, 이는 표준 자동에코더(40.00%)와 PCA(26.00%)를 모두 초월한다.
  • iFME 레이어는 정규화 기능을 수행하여 일반화 성능을 향상시킨다: 표준 자동에코더는 훈련 세트에서 약간 더 높은 성능를 보였지만, ManifoldNet은 테스트 세트에서 뚜렷한 성능 향상을 보였다.
  • 1280×720 비디오 시퀀스에서 iFME+자동에코더를 사용한 시각적 복원 결과는 PCA 및 표준 자동에코더보다 높은 시각적 품질을 보였으며, 전체 비디오 복원 결과를 비교할 수 있다.
  • 이 프레임워크는 비디오 분류 및 복원에서 최신 기술 수준의 성능를 보이며, wFM 레이어가 수축 사상 성질을 보이며 ReLU 유닛의 필요성을 제거한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.