Skip to main content
QUICK REVIEW

[논문 리뷰] Neural 3D Scene Compression via Model Compression

Berivan Isik|arXiv (Cornell University)|2021. 05. 07.
Advanced Vision and Imaging참고 문헌 40인용 수 8
한 줄 요약

이 논문은 신경 렌디언스 필드(NeRF)를 신경망 모델의 정밀도 절단을 통해 압축하여 중복되는 2D 이미지를 저장할 필요 없이 3D 시점 압축을 제안한다. 최대 90%의 NeRF 파라미터를 절단하고 재학습함으로써, 시각적 품질 손실이 최소화된 채로 최대 10배의 압축을 달성하며, 특히 30% 절단 시 PSNR가 약간 향상되고 잡음은 거의 없어진다.

ABSTRACT

Rendering 3D scenes requires access to arbitrary viewpoints from the scene. Storage of such a 3D scene can be done in two ways; (1) storing 2D images taken from the 3D scene that can reconstruct the scene back through interpolations, or (2) storing a representation of the 3D scene itself that already encodes views from all directions. So far, traditional 3D compression methods have focused on the first type of storage and compressed the original 2D images with image compression techniques. With this approach, the user first decodes the stored 2D images and then renders the 3D scene. However, this separated procedure is inefficient since a large amount of 2D images have to be stored. In this work, we take a different approach and compress a functional representation of 3D scenes. In particular, we introduce a method to compress 3D scenes by compressing the neural networks that represent the scenes as neural radiance fields. Our method provides more efficient storage of 3D scenes since it does not store 2D images -- which are redundant when we render the scene from the neural functional representation.

연구 동기 및 목표

  • 3D 시점 복원을 위해 대량의 2D 이미지를 저장하는 기존 3D 압축 기법의 비효율성을 해결하기 위해.
  • 이미지 기반 저장 방식에 비해 더 효율적인 대안으로 기능적 3D 시점 표현 방식—특히 NeRF—를 탐색하기 위해.
  • 특히 절단 기법을 직접 NeRF 모델에 적용하여 신경망 압축 기술을 통해 3D 시점 압축을 향상시키기 위해.
  • NeRF 기반 3D 시점 표현에서 압축 비율, 모델 크기, 렌더링 품질 간의 상호 상충 관계를 평가하기 위해.

제안 방법

  • 기존에 학습된 NeRF 모델의 완전히 연결된 층을 절단하여 3D 시점을 압축함으로써, 초기에는 재학습 없이 모델 파라미터를 감소시킴.
  • 절단 후, 렌더링 품질을 복구하고 잡음 문제를 완화하기 위해 재학습(파인튜닝)을 수행함.
  • NeRF의 기능적 특성—연속적인 5차원 함수(공간 좌표 및 시야 방향)를 입력으로 받아 색상과 밀도를 출력함—을 활용하여 기능적 표현 그 자체를 직접 압축함.
  • 압축 비율은 원본 모델 크기 대비 절단된 모델 크기의 비율로 측정되며, 최대 90% 절단 시 최대 10배의 압축 비율을 달성함.
  • 렌더링 품질 평가에는 합성 데이터셋(fern 및 lego)에서 PSNR 및 MSE 지표를 사용하여 원본, 절단, 재학습된 모델 간 비교 수행.
  • 렌더링된 시점, 깊이 맵, 메시 복원 결과를 대상으로 시각적 분석 및 정량적 평가를 수행하여 시각적 정밀도와 구조적 유사도 평가.

실험 결과

연구 질문

  • RQ1NeRF의 모델 절단이 3D 시점 렌더링 품질에 심각한 악영향을 주지 않으면서도 상당한 압축을 달성할 수 있는가?
  • RQ2절단 후 재학습이 압축된 NeRF 기반 3D 시점의 시각적 및 정량적 정밀도에 어떤 영향을 미치는가?
  • RQ3NeRF 기반 3D 시점 표현에서 압축 비율과 시각적 품질 간의 상호 상충 관계는 어떠한가?
  • RQ4절단이 기하학적 형태와 색상에 잡음 요소를 유발하는가? 그리고 재학습이 이를 효과적으로 완화할 수 있는가?
  • RQ5NeRF와 같은 기능적 3D 표현 방식은 절단과 같은 신경망 압축 기법을 통해 효과적으로 압축될 수 있는가?

주요 결과

  • 30% 절단 시, fern 데이터셋에서 PSNR는 25.41, lego 데이터셋에서 29.14를 기록하며 품질 저하가 최소화되고 원본 모델 대비 약간의 PSNR 향상까지 관찰됨.
  • 재학습 후 30% 절단 모델는 높은 정밀도를 유지하며, fern의 경우 PSNR 25.45, lego의 경우 30.43를 기록하여 잡음 복구가 효과적으로 이루어졌음을 시사함.
  • 50% 절단 시 PSNR는 각각 fern 22.48, lego 25.32로 하락하며 기하학적 및 색상 잡음이 명확히 관찰됨. 그러나 재학습으로 인해 품질이 크게 향상됨.
  • 70% 절단 시 PSNR는 각각 fern 20.97, lego 21.70로 감소하며 메시 및 깊이 맵 품질 저하가 눈에 띔. 그러나 재학습으로 인해 누락된 영역이 복구됨.
  • 90% 절단 시 PSNR는 각각 fern 16.87, lego 15.99로 급격히 감소하여 심각한 품질 손실을 보이지만, 재학습으로 인해 공백 영역이 채워져 복원이 가능함.
  • 최대 10배의 압축 비율(90% 절단 시)을 달성하였으며, MSE 값은 각각 fern 0.0706, lego 0.0786을 기록하여 품질의 상실에도 불구하고 높은 저장 효율성을 입증함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.