Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Discovery and Composition of Object Light Fields

Cameron M. Smith, Hong-Xing Yu|arXiv (Cornell University)|2022. 05. 08.
Advanced Vision and Imaging인용 수 6
한 줄 요약

이 논문은 신경 빛장을 사용하여 3D 객체 중심 영역을 비지도 학습으로 탐지하고 렌더링하는 새로운 방법인 조합적 객체 빛장(Compositional Object Light Fields, COLF)을 제안한다. 체적 렌더링을 대체하기 위해 학습 가능한 빛장 조합 모듈을 도입함으로써, COLF는 체적 렌더링 기반 기존 방법에 비해 수십만 배 빠른 추론 및 학습 속도를 달성하면서도 상태최저 수준의 재구성 및 새로운 시점 렌더링 성능을 확보하여, 수십 개의 객체를 포함하는 시나리오의 실시간 렌더링을 가능하게 한다.

ABSTRACT

Neural scene representations, both continuous and discrete, have recently emerged as a powerful new paradigm for 3D scene understanding. Recent efforts have tackled unsupervised discovery of object-centric neural scene representations. However, the high cost of ray-marching, exacerbated by the fact that each object representation has to be ray-marched separately, leads to insufficiently sampled radiance fields and thus, noisy renderings, poor framerates, and high memory and time complexity during training and rendering. Here, we propose to represent objects in an object-centric, compositional scene representation as light fields. We propose a novel light field compositor module that enables reconstructing the global light field from a set of object-centric light fields. Dubbed Compositional Object Light Fields (COLF), our method enables unsupervised learning of object-centric neural scene representations, state-of-the-art reconstruction and novel view synthesis performance on standard datasets, and rendering and training speeds at orders of magnitude faster than existing 3D approaches.

연구 동기 및 목표

  • 객체 중심 신경 렌더링 장치에서 체적 렌더링의 높은 계산 비용 문제를 해결하여 확장성과 렌더링 품질 향상을 도모한다.
  • 선형적이지 않은 부분 빛장의 조합 문제를 해결한다. 이는 레이 쿼리에서 깊이 순서가 알려지지 않은 상황에서 발생한다.
  • 2D 이미지에서 객체 중심 3D 표현을 비지도로 탐지하고 일반화 능력과 렌더링 효율성을 향상시킨다.
  • 기존 최상위 성능(SOTA) 방법들과 비교해도 재구성 정밀도를 유지하거나 향상시키면서 실시간 렌더링 및 학습 속도를 달성한다.

제안 방법

  • 각 객체를 체적 렌더링 대비 레이당 계산량을 크게 줄일 수 있도록, 각 레이를 객체당 한 번만 샘플링하는 신경 빛장으로 표현한다.
  • 레이의 깊이 순서에 기반해 각 객체의 빛장에 대해 부드러운 가시성 가중치를 추정하는 학습 가능한 빛장 조합 모듈을 도입하여, 객체 중심 빛장을 전역 시나리오 빛장으로 미분 가능하게 조합한다.
  • 슬롯 어텐션을 사용해 2D 이미지에서 객체 코드를 추론하고, 이를 바탕으로 각 객체의 빛장 네트워크에 색상 및 깊이 순서 특징을 쿼리한다.
  • 예측된 이미지와 진짜 이미지 간의 픽셀 수준 재구성 오차를 최소화하는 미분 가능한 렌더링 목표함수를 사용해 모델을 종합적으로 학습한다.
  • 빛장 네트워크에 주기적 활성화 함수와 푸리에 특징을 활용해 표현 능력과 렌더링 품질을 향상시킨다.
  • 객체 중심 빛장 좌표를 변형함으로써 시나리오 편집을 가능하게 하여, 재학습 없이도 객체를 이동시키거나 다른 시나리오에 조합할 수 있다.

실험 결과

연구 질문

  • RQ1해당 깊이 순서가 명시되지 않은 상황에서, 신경 빛장을 사용해 객체 중심 3D 시나리오를 표현하고, 명시적인 깊이 순서 없이도 효율적이고 미분 가능한 조합을 가능하게 할 수 있는가?
  • RQ2학습 가능한 조합 모듈이 겹치는 객체 빛장에 대해 부드러운 가시성 추정을 효과적으로 수행할 수 있는가? 이를 통해 정확한 전역 빛장 재구성가 가능한가?
  • RQ3체적 렌더링을 단일 샘플링 빛장 렌더링으로 대체함으로써, 성능 유지 또는 향상과 함께 렌더링 속도를 크게 향상시킬 수 있는가?
  • RQ4제안된 방법이 학습 중에 관찰하지 못한 더 많은 객체를 포함한 시나리오, 특히 복잡하고 혼잡한 환경에서도 일반화 가능한가?
  • RQ5모델이 실시간으로 수십 개의 객체를 포함한 무한정 확장 가능한 시나리오에서 상호작용 가능한 편집 및 조합 기능을 얼마나 잘 지원하는가?

주요 결과

  • COLF는 표준 벤치마크에서 최상의 새로운 시점 렌더링 성능을 달성하였으며, CLEVR-11 데이터셋에서 LPIPS 점수 0.1128을 기록하여 uORF(0.1540)와 NeRF-AE(0.2201)를 모두 앞서나갔다.
  • 체적 렌더링 기반 접근 방식 대비 학습 및 추론 속도가 2개 주기만큼 빨라졌으며, 최대 20개의 객체를 포함한 시나리오의 실시간 렌더링이 가능해졌다.
  • 7개 객체를 학습한 것보다 더 많은 11개 객체를 포함한 시나리오에서도 잘 일반화되며, 세그멘테이션 및 시점 렌더링 모두에서 뛰어난 성능을 유지했다.
  • 모델은 도시 블록 시나리오와 같은 복잡한 환경을 배경과 차량 빛장으로 성공적으로 분해하여 정확한 편집과 조합이 가능하게 했다.
  • 빛장 조합 모듈은 알려지지 않은 깊이 순서 상황에서도 효과적으로 작동하여, 객체 중심 빛장의 미분 가능하고 안정적인 조합을 가능하게 했다.
  • 보조 결과에서는 이전의 체적 렌더링 기반 기준 모델이 같은 시나리오를 렌더링하기 위해 허용 불가능한 높은 계산 비용이 소요됨을 확인하여, COLF의 효율성 우월성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.