Skip to main content
QUICK REVIEW

[논문 리뷰] LightSAL: Lightweight Sign Agnostic Learning for Implicit Surface Representation

Abol Basher, Muhammad Sarmad|arXiv (Cornell University)|2021. 03. 26.
3D Shape Modeling and Analysis참고 문헌 55인용 수 5
한 줄 요약

LightSAL은 원시 포인트 클라우드에서 신호에 의존하지 않는 학습을 통해 암묵적 3D 표면 재구성용 경량이고 효율적인 인코더-디코더 신경망을 제안한다. 기준 모델인 SAL과 동일한 재구성 품질을 달성하면서도 파rameter 수를 75% 감소시키고 학습 에포크 수를 75% 줄였으며, 모드 붕괴 문제를 피한다.

ABSTRACT

Recently, several works have addressed modeling of 3D shapes using deep neural networks to learn implicit surface representations. Up to now, the majority of works have concentrated on reconstruction quality, paying little or no attention to model size or training time. This work proposes LightSAL, a novel deep convolutional architecture for learning 3D shapes; the proposed work concentrates on efficiency both in network training time and resulting model size. We build on the recent concept of Sign Agnostic Learning for training the proposed network, relying on signed distance fields, with unsigned distance as ground truth. In the experimental section of the paper, we demonstrate that the proposed architecture outperforms previous work in model size and number of required training iterations, while achieving equivalent accuracy. Experiments are based on the D-Faust dataset that contains 41k 3D scans of human shapes. The proposed model has been implemented in PyTorch.

연구 동기 및 목표

  • 기존의 암묵적 3D 형태 학습 방법이 모델 크기와 학습 시간 측면에서 효율성이 떨어지는 문제를 해결한다.
  • 사전 처리된 서피스 거리 필드가 필요 없이 원시 포인트 클라우드 또는 삼각형 군집에서 직접 신호에 의존하지 않는 학습을 가능하게 한다.
  • 계산 및 메모리 비용을 줄이면서도 높은 재구성 품질을 유지하는 컴act한 신경망 아키텍처를 설계한다.
  • 학습 중 모드 붕괴에 대한 강건성을 보이며, 지표 형태에서 벗어나지 않는 재구성을 방지한다.

제안 방법

  • 인코더와 디코더 양쪽에 커널 크기가 1인 1D 컨볼루션을 사용한 경량 인코더-디코더 아키텍처를 제안하여, 완전히 연결된 계층을 대체해 파rameter 수를 감소시킨다.
  • 기본값으로 부호 없는 거리 필드를 사용해 신호에 의존하지 않는 학습을 도입함으로써, 닫힌 표면이나 사전 계산된 부호 거리가 필요 없도록 한다.
  • 순서가 없는 포인트 클라우드 입력을 처리하기 위해 1×1 커널을 사용한 1D 컨볼루션 레이어로 구성된 공유 MLP를 구현하여 대칭 풀링을 통해 순열 불변성을 확보한다.
  • 원시 3D 포인트 클라우드에서 재구성 손실을 사용해 네트워크를 학습시키며, 암묵적 표면은 네트워크 출력의 영점 수준 집합으로 정의한다.
  • 희박한 포인트 클라우드에서 국소적이고 전역적인 기하학적 특징을 캡처하기 위해 인코더에 다중 척도 특징 집약 전략을 활용한다.
  • GPU 메모리 제약으로 인해 배치 크기를 16으로 설정하고, 학습 효율성을 높이기 위해 재구성 해상도를 100으로 제한하여 Adam 최적화를 수행한다.

실험 결과

연구 질문

  • RQ1신호에 의존하지 않는 학습을 통해 훈련된 경우, 상당히 작은 신경망이 전체 크기의 SAL 모델과 동일한 3D 형태 재구성 품질을 달성할 수 있는가?
  • RQ2모델 크기와 학습 에포크 수를 줄여도 재구성 정밀도나 일반화 능력에 손상이 가지 않는가?
  • RQ31D 컨볼루션 기반의 공유 MLP가 인코더와 디코더에서 완전히 연결된 계층을 대체해 성능을 유지하면서도 파rameter 수를 줄일 수 있는가?
  • RQ4제안된 아키텍처는 학습 중에 모드 붕괴를 피할 수 있는가? 즉, 지표 형태에서 벗어나는 재구성을 방지하는가?
  • RQ5과적합 없이 미리 보지 않은 인간 형태와 자세에 대해 일반화 능력이 뛰어나게 되는가?

주요 결과

  • LightSAL은 기준 모델인 SAL에 비해 학습 가능한 파arameter 수를 75% 감소시켜 1.05M 파arameter로 줄였으며, SAL의 4.2M에 비해 약 75% 감소하였다.
  • 기준 SAL 모델이 2000 에포크가 필요한 데 비해, LightSAL은 동일한 재구성 품질에 도달하기 위해 단 500 에포크만으로도 충분하다.
  • 파arameter 수 감소와 효율적인 1D 컨볼루션 레이어 덕분에, LightSAL은 에포크당 학습 속도가 40% 빠르다.
  • 학습 중에 모드 붕괴가 관측되지 않아 우수한 일반화 능력을 보였으며, 이는 기준 SAL 모델가 때때로 입력 데이터와 일치하지 않는 형태를 재구성하는 것과 대비된다.
  • D-Faust 데이터셋에서 LightSAL은 낮은 능력에도 불구하고, 미리 보지 않은 인간 형태와 자세에 대해 기준 모델을 초월하는 재구성 품질을 보였다.
  • 실험 결과, 1×1 커널을 사용한 1D 컨볼루션은 더 큰 커널과 동일한 성능을 내지만 파arameter 수를 크게 줄여 아키텍처 선택의 타당성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.