Skip to main content
QUICK REVIEW

[논문 리뷰] Masked Space-Time Hash Encoding for Efficient Dynamic Scene Reconstruction

Feng Wang, Zilong Chen|arXiv (Cornell University)|2023. 10. 26.
Advanced Vision and Imaging인용 수 4
한 줄 요약

이 논문은 불확실성 기반 공간-시간 역동성에 의해 유도되는 동적 3D 장면 재구성의 효율성을 높이기 위해 학습 가능한 마스크를 사용해 3D 해시 인코딩과 4D 해시 인코딩을 동적으로 가중하는 새로운 방법인 마스킹된 공간-시간 해시 인코딩(MSTH)을 제안한다. 정적 영역에서의 중복된 4D 해시 테이블 쿼리를 줄임으로써 MSTH는 단지 20분의 훈련과 130MB의 메모리로 최신 기술 수준의 렌더링 품질을 달성하며, 이는 이전 방법들에 비해 속도, 메모리 효율성, 재구성 정밀도 면에서 뚜렷한 우월성을 보인다.

ABSTRACT

In this paper, we propose the Masked Space-Time Hash encoding (MSTH), a novel method for efficiently reconstructing dynamic 3D scenes from multi-view or monocular videos. Based on the observation that dynamic scenes often contain substantial static areas that result in redundancy in storage and computations, MSTH represents a dynamic scene as a weighted combination of a 3D hash encoding and a 4D hash encoding. The weights for the two components are represented by a learnable mask which is guided by an uncertainty-based objective to reflect the spatial and temporal importance of each 3D position. With this design, our method can reduce the hash collision rate by avoiding redundant queries and modifications on static areas, making it feasible to represent a large number of space-time voxels by hash tables with small size.Besides, without the requirements to fit the large numbers of temporally redundant features independently, our method is easier to optimize and converge rapidly with only twenty minutes of training for a 300-frame dynamic scene.As a result, MSTH obtains consistently better results than previous methods with only 20 minutes of training time and 130 MB of memory storage. Code is available at https://github.com/masked-spacetime-hashing/msth

연구 동기 및 목표

  • 시간적 중복성으로 인해 4D 해시 인코딩의 계산 비용과 메모리 소비가 높아지는 동적 장면 재구성 문제를 해결하기 위해.
  • 정적 및 동적 장면 구성 요소를 분리함으로써 렌더링 품질과 최적화 효율성을 향상시키기 위해.
  • 정적 영역에서의 중복 업데이트를 피함으로써 4D 표현에서의 해시 충돌을 줄이기 위해.
  • 광범위한 초기 설정 조정 없이도 단지 20분의 훈련으로 빠른 수렴을 달성하고 최신 기술 수준의 성능을 내기 위해.
  • 새로가 수집한 다중 시점 영상 데이터셋을 통해 실제적이고 복잡한 동적 장면에서의 강인성을 검증하기 위해.

제안 방법

  • MSTH는 정적 구성 요소를 위한 3D 해시 인코딩과 동적 구성 요소를 위한 4D 해시 인코딩의 가중 조합으로 동적 장면을 표현하며, 이 가중치는 미분 가능한 3D 마스크를 통해 학습된다.
  • 마스크는 Kendall과 Gal(2017)의 베이지안 프레임워크에서 유도된 불확실성 기반 목표 함수에 의해 유도되며, 각 3D 점이 정적일 가능성의 불확실성을 추정한다.
  • 이 방법은 불확실성 추정과 마스크 간의 상호정보량을 최대화하여, 낮은 불확실성(정적) 영역이 주로 3D 해시 테이블에 인코딩되도록 보장한다.
  • 정적 영역에서 동적 구성 요소에 대해 낮은 가중치를 할당함으로써 MSTH는 4D 해시 테이블의 충돌을 줄이고 중복된 특징 저장 및 업데이트를 방지한다.
  • 4D 해시 테이블의 크기는 3D 테이블과 유사하게 유지되어, 재구성 품질을 희생시키지 않은 채 압축된 표현을 가능하게 한다.
  • 모델은 다중 시점 또는 단일 시점 영상 입력을 사용해 엔드 투 엔드로 훈련되며, 시각 합성 최적화를 위해 레디언스 필드 손실을 사용한다.

실험 결과

연구 질문

  • RQ1학습 가능한 마스크를 갖춘 하이브리드 3D+4D 해시 인코딩이 순수 4D 인코딩에 비해 동적 장면 재구성의 효율성과 품질을 향상시키는가?
  • RQ2불확실성 추정이 정적 및 동적 구성 요소 간의 표현 할당에 얼마나 효과적으로 기여하는가?
  • RQ3기존 방법들과 비교해 훨씬 적은 훈련 시간과 메모리 사용량으로 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ4큰 정적 영역과 복잡한 운동을 포함한 실제 세계의 복잡한 동적 장면에서 이 방법은 어떻게 성능을 발휘하는가?
  • RQ5불확실성 유도 마스크는 얼마나 해시 충돌을 줄이고 최적화 안정성을 향상시키는가?

주요 결과

  • MSTH는 Google Immersive 데이터셋에서 PSNR 29.6, D-NeRF 데이터셋에서 PSNR 31.34를 기록하여 NeRFPlayer, HyperReel, HexPlane을 포함한 모든 이전 방법들을 능가한다.
  • 동일한 벤치마크에서 MSTH는 훈련 시간을 단지 20분으로 줄였으며, NeRFPlayer의 6시간, HyperReel의 2.7시간에 비해 뚜렷한 개선을 보였다.
  • D-NeRF 데이터셋에서 MSTH는 추가 기반 아블레이션 대비 LPIPS를 0.02 감소시켜 20% 향상된 시각적 품질을 확보했다.
  • 정성적 비교에서 MSTH는 얼굴 특징, 튀는 스파arks, 무늬 무늬의 질감과 같은 미세한 운동 세부 사항을 최신 기술 수준의 방법들보다 더 정확하게 재구성했다.
  • 불확실성 유도 마스크는 더 명확하고 노이즈가 적은 분포를 만들어내어 정적 및 동적 영역 간의 분리가 더 잘 이루어지고 해시 충돌이 줄어들게 했다.
  • 새로가 수집한 캠퍼스 데이터셋의 도전적인 장면들에서도 MSTH는 PSNR 20.9, SSIM 0.722를 유지하며 실제 환경에서의 강인성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.