Skip to main content
QUICK REVIEW

[논문 리뷰] Uncertainty Guided Policy for Active Robotic 3D Reconstruction using Neural Radiance Fields

Soomin Lee, Le Chen|arXiv (Cornell University)|2022. 09. 17.
Advanced Vision and Imaging인용 수 4
한 줄 요약

이 논문은 신경 렌디언스 필드(NeRF)를 사용한 주행 로봇 3D 재구성에서 불확실성 유도형 다음 최적의 시점 정책을 제안한다. NeRF 표현 내 광선을 따라 가중치 분포의 엔트로피를 계산하여 부피적 불확실성을 추정하고, 재구성 품질 향상을 위해 시점 선택을 유도한다. 더 적은 수의 시점으로도 합성 및 실세계 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In this paper, we tackle the problem of active robotic 3D reconstruction of an object. In particular, we study how a mobile robot with an arm-held camera can select a favorable number of views to recover an object's 3D shape efficiently. Contrary to the existing solution to this problem, we leverage the popular neural radiance fields-based object representation, which has recently shown impressive results for various computer vision tasks. However, it is not straightforward to directly reason about an object's explicit 3D geometric details using such a representation, making the next-best-view selection problem for dense 3D reconstruction challenging. This paper introduces a ray-based volumetric uncertainty estimator, which computes the entropy of the weight distribution of the color samples along each ray of the object's implicit neural representation. We show that it is possible to infer the uncertainty of the underlying 3D geometry given a novel view with the proposed estimator. We then present a next-best-view selection policy guided by the ray-based volumetric uncertainty in neural radiance fields-based representations. Encouraging experimental results on synthetic and real-world data suggest that the approach presented in this paper can enable a new research direction of using an implicit 3D object representation for the next-best-view problem in robot vision applications, distinguishing our approach from the existing approaches that rely on explicit 3D geometric modeling.

연구 동기 및 목표

  • 정보 수확을 극대화해야 하는 로봇 시스템에서의 주행 3D 재구성을 해결한다.
  • 노이즈, 음영, 재구성 잡음 등으로 인해 문제가 되는 포인트 클라우드나 볼륨 메시 같은 명시적 3D 표현에 의존하는 기존 방법의 한계를 극복한다.
  • 고해상도 기하학적 및 외관 모델링을 제공하는 암시적 신경 표현인 NeRF를 활용해 효율적이고 정확한 밀도 높은 3D 재구성을 가능하게 한다.
  • 다양한 NeRF 기반 아키텍처에 적용 가능한 일반화 가능한 불확실성 추정 방법을 개발한다.

제안 방법

  • NeRF 표현 내 각 광선을 따라 색상 샘플의 가중치 분포 엔트로피를 계산하는 광선 기반 부피적 불확실성 추정기를 제안한다.
  • 추정된 불확실성을 기하학적 모호성의 대체 지표로 사용하여 고도로 불확실한 영역을 식별하고 추가 관측이 필요한 영역을 파악한다.
  • 높은 불확실성을 가진 시점을 우선순위로 삼고, 지역 집중을 방지하기 위해 영역 클러스터링을 적용하는 다음 최적의 시점 선택 정책을 설계한다.
  • 매번 새로운 시점을 확보한 후 NeRF를 재학습하는 반복적 재구성 파이프라인에 불확실성 유도 정책을 통합한다.
  • 모델에 종속되지 않는 적용 가능성을 입증하기 위해 표준 NeRF와 더 빠른 TensoRF 모두에서 방법을 검증하여 일관된 성능 향상을 보였다.
  • 동적 시점 계획에 불확실성 추정기를 활용하여 최소한의 시점 수로도 점진적으로 3D 재구성 품질을 향상시킨다.

실험 결과

연구 질문

  • RQ1NeRF 광선의 가중치 분포에서의 불확실성은 암시적 3D 표현에서 기하학적 불확실성의 신뢰할 수 있는 대체 지표가 될 수 있는가?
  • RQ2무작위, 히우리스틱, 유사도 기반 기준과 비교할 때, 불확실성 유도 정책은 주행 3D 재구성에서 정보성 있는 다음 최적의 시점을 얼마나 효과적으로 선택하는가?
  • RQ3전체 시점 확보와 비교할 때, 제안된 방법이 재구성 품질을 유지하거나 향상시키면서 필요한 시점 수를 얼마나 줄일 수 있는가?
  • RQ4이 불확실성 추정 방법은 NeRF 기반 아키텍처 전반에 일반화 가능한가, 특히 더 빠른 변종인 TensoRF와도 호환되는가?

주요 결과

  • 제안된 불확실성 유도 정책은 단지 54장의 이미지로 LEO 벤치마크에서 F-score 0.5078을 달성하여, 무작위(0.4895), 히우리스틱(0.4234), 유사도 기반 정책(0.4163)을 모두 초월했다.
  • 단지 54장의 이미지로도 전체 150장의 이미지로 확보한 것과 유사한 3D 메시 품질을 달성하여 높은 샘플 효율성을 입증했다.
  • 픽셀 평균 엔트로피는 초기 상태의 1.748에서 네 번의 반복 후 0.790으로 감소하여 불확실성의 점진적 감소와 재구성 신뢰도 향상을 확인했다.
  • TensoRF를 사용할 경우 불확실성 계산 시간이 5분에서 2.8분으로 감소하여 빠른 NeRF 구현과의 호환성을 입증했다.
  • 절단 실험 결과, 영역 클러스터링이 뷰 집중을 방지하고 음영 영역을 커버하는 데 기여하여 재구성 품질을 크게 향상시킨다는 것이 확인되었다.
  • 메서드가 NeRF 변종으로 일반화됨을 입증하기 위해 TensoRF로의 전이가 최소한의 재학습으로도 성공적으로 수행되었고, 일관된 성능 향상이 관찰되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.