Skip to main content
QUICK REVIEW

[논문 리뷰] MINER: Multiscale Implicit Neural Representations

Vishwanath Saragadam, Jasper Tan|arXiv (Cornell University)|2022. 02. 07.
Model Reduction and Neural Networks인용 수 8
한 줄 요약

MINER는 라플라시안 피라미드를 사용하여 신호를 다중 척도에서 희박하고 직교적인 성분으로 분해하는 다중 척도 암묵적 신경망 표현을 도입한다. 각 척도에서 분리된 패치에 대해 작은 국소적 MLP를 훈련함으로써, 굵은 척도에서 미세한 척도로 진행하면서 10배 빠른 훈련, 25% 미만의 파라미터 수, ACORN 대비 10%의 계산 시간을 달성하면서 기가픽셀 이미지와 빌리언 포인트 3D 포인트 클라우드에서 높은 정확도를 유지한다.

ABSTRACT

We introduce a new neural signal model designed for efficient high-resolution representation of large-scale signals. The key innovation in our multiscale implicit neural representation (MINER) is an internal representation via a Laplacian pyramid, which provides a sparse multiscale decomposition of the signal that captures orthogonal parts of the signal across scales. We leverage the advantages of the Laplacian pyramid by representing small disjoint patches of the pyramid at each scale with a small MLP. This enables the capacity of the network to adaptively increase from coarse to fine scales, and only represent parts of the signal with strong signal energy. The parameters of each MLP are optimized from coarse-to-fine scale which results in faster approximations at coarser scales, thereby ultimately an extremely fast training process. We apply MINER to a range of large-scale signal representation tasks, including gigapixel images and very large point clouds, and demonstrate that it requires fewer than 25% of the parameters, 33% of the memory footprint, and 10% of the computation time of competing techniques such as ACORN to reach the same representation accuracy.

연구 동기 및 목표

  • 대규모 신호에 대한 신경 암묵적 표현에서 단일 큰 MLP의 높은 계산 비용과 메모리 사용량 문제를 해결한다.
  • 시각 신호에서 척도 간 자가 유사성 특성을 활용하여 효율적이고 계층적인 표현을 가능하게 한다.
  • 기가픽셀 이미지와 3D 포인트 클라우드에서 높은 표현 정확도를 유지하면서 훈련 시간과 모델 복잡도를 줄인다.
  • 3D 볼륨과 고해상도 이미지와 같은 매우 고차원적 신호에 대해 신경 암묵적 표현의 실용적 구현을 가능하게 한다.
  • 다중 척도 분해와 블록 단위의 프루닝 및 점진적 훈련을 조합하여 컴act하고 메모리 효율적이며 빠른 훈련을 달성한다.

제안 방법

  • 입력 신호를 라플라시안 피라미드로 분해하여 공간 척도 간 다중 척도, 직교적인 신호 성분을 확보한다.
  • 고정된 크기의 분리된 이미지 또는 볼륨 패치에서 훈련된 여러 작은 국소적 MLP를 사용해 각 척도를 표현한다.
  • 라플라시안 피라미드 성분 간 거의 직교성 특성을 활용하여, 굵은 척도에서부터 미세한 척도로 점진적으로 훈련함으로써 반복적 정밀도 향상을 달성한다.
  • 훈련 이전에 프루닝 전략을 적용한다: 변동성이 낮은(신호 에너지가 거의 0에 가까운) 블록은 제외하여 더 미세한 척도에서 활성화되는 MLP 수를 줄인다.
  • 각 블록의 평균 제곱오차(MSE) 임계값($10^{-4}$)을 사용해 훈련에 포함할지 여부를 결정함으로써 계산 효율성을 확보한다.
  • 라플라시안 피라미드의 계층적 구조와 블록 기반 표현을 활용하여 스트리밍 재구성과 수준 기반 렌더링을 가능하게 한다.

실험 결과

연구 질문

  • RQ1라플라시안 피라미드를 사용한 다중 척도 신경 표현은 단일 척도 암묵적 네트워크보다 더 빠른 훈련과 낮은 메모리 사용을 달성할 수 있는가?
  • RQ2희박한 신호 성분에 대해 국소적 MLP를 굵은 척도에서부터 점진적으로 훈련할 경우 수렴 속도와 표현 정확도에 어떤 영향을 미치는가?
  • RQ3신호 분산 기반의 블록 프루닝이 재구성 품질을 훼손하지 않으면서 파라미터 수와 계산량을 얼마나 줄일 수 있는가?
  • RQ4제안된 방법은 기가픽셀 이미지와 빌리언 포인트 3D 포인트 클라우드에 대해 ACORN과 같은 최첨단 기술을 능가하면서 효율적으로 확장 가능한가?
  • RQ5MINER의 계층적 다중 척도 구조는 실시간 렌더링이나 메쉬 압축과 같은 실용적 응용을 지원하는가?

주요 결과

  • MINER는 기간 3D 태국 상점 포인트 클라우드에서 6분 이내에 IoU 0.999를 달성했으며, ACORN은 53분이 소요되었고 유사 정확도에 도달하기까지 7시간 이상이 걸렸다.
  • 가장 미세한 척도에서 MINER는 990만 개의 파라미터와 37.9MB 디스크 공간을 사용하지만, ACORN은 1700만 개의 파라미터와 68MB를 필요로 하여 파라미터 수 42% 감소, 디스크 크기 45% 감소를 기록했다.
  • 같은 훈련 시간(6분) 동안 MINER는 ACORN 대비 10배 빠른 수렴 속도를 보이며 IoU 0.99를 달성했고, ACORN은 이 시간 동안 단지 0.97 IoU에 도달했다.
  • MINER는 3시간 이내에 기가픽셀 이미지를 >38dB PSNR로 표현했으며, ACORN은 이를 초과 일일 이상 소요되었고, 이는 훈련 속도 향상 10배를 의미한다.
  • MINER의 가장 굵은 척도(스케일 3)는 17초 만에 0.95 IoU를 달성했고, 파라미터 수 90만 개, 디스크 크기 3.5MB로 낮은 자원 소비로 빠른 초도 근사치를 제공한다.
  • MINER는 표준 PLY 메쉬 파일(180MB 대비 3.5MB)의 디스크 공간의 1/3 미만을 점유하여 효과적인 메쉬 압축을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.