Skip to main content
QUICK REVIEW

[논문 리뷰] Coordinates Are NOT Lonely -- Codebook Prior Helps Implicit Neural 3D Representations

Fukun Yin, Wen Liu|arXiv (Cornell University)|2022. 10. 20.
3D Shape Modeling and Analysis인용 수 6
한 줄 요약

이 논문은 좌표 기반 다층 퍼셉트론(MLP)을 개선하기 위해 학습된 코드북을 통한 사전 지식을 두 가지 어텐션 모듈인 코드북 어텐션과 좌표 어텐션을 통해 통합하는 CoCo-INR라는 새로운 암묵적 신경 3D 표현 프레임워크를 제안한다. 사전에 훈련된 프로토타입을 활용하여, 단 3~8장의 입력 뷰만으로도 고화질의 신규 뷰 합성과 3D 재구성에서 최신 기술 수준의 성능을 달성하며, 희박한 감독 조건에서도 사진 수준의 현실감과 기하학적 정확도를 크게 향상시킨다.

ABSTRACT

Implicit neural 3D representation has achieved impressive results in surface or scene reconstruction and novel view synthesis, which typically uses the coordinate-based multi-layer perceptrons (MLPs) to learn a continuous scene representation. However, existing approaches, such as Neural Radiance Field (NeRF) and its variants, usually require dense input views (i.e. 50-150) to obtain decent results. To relive the over-dependence on massive calibrated images and enrich the coordinate-based feature representation, we explore injecting the prior information into the coordinate-based network and introduce a novel coordinate-based model, CoCo-INR, for implicit neural 3D representation. The cores of our method are two attention modules: codebook attention and coordinate attention. The former extracts the useful prototypes containing rich geometry and appearance information from the prior codebook, and the latter propagates such prior information into each coordinate and enriches its feature representation for a scene or object surface. With the help of the prior information, our method can render 3D views with more photo-realistic appearance and geometries than the current methods using fewer calibrated images available. Experiments on various scene reconstruction datasets, including DTU and BlendedMVS, and the full 3D head reconstruction dataset, H3DS, demonstrate the robustness under fewer input views and fine detail-preserving capability of our proposed method.

연구 동기 및 목표

  • 고품질 재구성에 대해 밀도 높은 입력 뷰가 필요한 암묵적 신경 3D 표현의 한계를 해결하기 위해.
  • 코드북에서 유도된 사전 지식이 암묵적 신경망 내 좌표 특징 표현을 어떻게 풍부하게 할 수 있는지 탐색하기 위해.
  • 구조화된 사전 지식 정보를 도입하여 대규모 캘리브레이션 이미지의 수에 의존도를 낮추기 위해.
  • 희박한 입력 설정 조건 하에서 신규 뷰 합성의 강건성과 현실감을 향상시키기 위해.
  • 더 나은 일반화 성능을 위해 좌표와 학습된, 장면에 관계없는 프로토타입을 연결하는 새로운 패러다임을 구축하기 위해.

제안 방법

  • 학습 가능한 임bedding를 사용해 사전에 훈련된 고정된 코드북에서 장면 관련 프로토타입을 질의하는 코드북 어텐션 모듈을 도입한다.
  • 선택된 프로토타입을 각 공간 좌표에 통합하여 특징 표현을 풍부하게 하는 좌표 어テン션 모듈을 활용한다.
  • 고정된 사전에 훈련된 VQ-VAE 코드북(예: VQGAN을 통해 ImageNet에서 유도)을 사용하여 일관되고 고수준의 의미적 사전 지식을 제공한다.
  • 두 어텐션 모듈을 공유된 MLP 아키텍처에 적용하여 코드북의 각 장면별 미세조정 없이도 특징 학습을 향상시킨다.
  • 다양한 기반 어텐션 메커니즘을 사용해 동적 융합을 허용하는 미분 가능한 어텐션 기반 기반으로 네트워크를 엔드 투 엔드로 훈련한다.
  • 매우 희박한 뷰(예: 3장)를 사용한 훈련 중 마스킹을 적용하여 배경 기하학적 구조와 외관에 집중한다.

실험 결과

연구 질문

  • RQ1희박한 입력 뷰(예: 몇 장의 뷰만 존재) 조건에서 사전에 훈련된 코드북의 사전 지식이 3D 재구성 및 신규 뷰 합성 품질을 향상시킬 수 있는가?
  • RQ2좌표 특징에 코드북 프로토타입을 통합할 경우, 희박한 감독 조건 하에서 네트워크의 신규 뷰 일반화 능력은 어떻게 영향을 받는가?
  • RQ3고정된 사전에 훈련된 코드북과 각 장면에 맞게 학습되는 코드북을 비교했을 때, 저샷 3D 재구성에서의 영향은 어떠한가?
  • RQ4코드북 항목의 수와 품질이 암묵적 신경 표현의 성능에 어떤 영향을 미치는가?
  • RQ5프로토타입과 좌표의 어텐션 기반 융합이 기존의 MLP 기반 접근 방식보다 더 사진 수준의 현실감과 기하학적 정확도를 갖춘 렌더링을 가능하게 하는가?

주요 결과

  • DTU 데이터셋에서 단 3장의 훈련 뷰만으로 CoCo-INR는 평균 PSNR 19.084를 기록하며 VolSDF(18.939)를 능가하고, LPIPS는 0.165(25% 감소)로 기록하여 의미 수준의 현실감이 뛰어나다는 것을 보여준다.
  • 5~8장의 뷰를 사용할 경우, 고정된 사전에 훈련된 코드북을 사용한 방법은 per-scene 학습 가능한 코드북(13.315)보다 유의미하게 높은 15.622 PSNR를 기록하여 일반화 가능한 사전 지식의 가치를 입증한다.
  • 16,384개의 코드북 항목을 사용할 경우 최고의 성능(PSNR: 15.622)을 기록하며, 항목 수가 줄어들수록 성능이 저하됨을 확인하여 코드북 크기 민감도를 확인한다.
  • 제거 실험 결과, 코드북 어텐션은 균일한 무늬를 가진 장면에서 의미 있는 프로토타입을 추출함으로써 강건성을 향상시킨다는 점을 입증한다.
  • 시각화 결과, CoCo-INR는 극단적으로 희박한 뷰(3장) 조건에서도 미세한 기하학적 디테일을 유지하고 일관되고 사진 수준의 현실감 있는 신규 뷰를 생성함을 보여준다.
  • DTU, BlendedMVS, H3DS 등 다양한 벤치마크에 대해 잘 일반화되며, 코드북 사전 지식의 강력한 제로샷 전이 성능을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.