Skip to main content
QUICK REVIEW

[논문 리뷰] AutoNeRF: Training Implicit Scene Representations with Autonomous Agents

Pierre Marza, Laëtitia Matignon|arXiv (Cornell University)|2023. 04. 21.
Robot Manipulation and Learning인용 수 5
한 줄 요약

AutoNeRF는 인간 간섭 없이 3D 환경을 자율 탐색하여 신경 렌더링 필드(NeRF) 학습을 위한 데이터를 수집하는 강화학습 기반 모듈러 에이전트를 제안한다. 이 방법은 단일 탐색 에피소드만으로도 3D 환경 재구성, 계획, 자세 정밀화 등의 후행 로봇 작업에서 최신 기술 수준의 성능을 달성하며, 모듈러 정책이 프론티어 기반 및 엔드 투 엔드 강화학습 기반 베이스라인보다 뛰어난 성능을 보인다.

ABSTRACT

Implicit representations such as Neural Radiance Fields (NeRF) have been shown to be very effective at novel view synthesis. However, these models typically require manual and careful human data collection for training. In this paper, we present AutoNeRF, a method to collect data required to train NeRFs using autonomous embodied agents. Our method allows an agent to explore an unseen environment efficiently and use the experience to build an implicit map representation autonomously. We compare the impact of different exploration strategies including handcrafted frontier-based exploration, end-to-end and modular approaches composed of trained high-level planners and classical low-level path followers. We train these models with different reward functions tailored to this problem and evaluate the quality of the learned representations on four different downstream tasks: classical viewpoint rendering, map reconstruction, planning, and pose refinement. Empirical results show that NeRFs can be trained on actively collected data using just a single episode of experience in an unseen environment, and can be used for several downstream robotic tasks, and that modular trained exploration models outperform other classical and end-to-end baselines. Finally, we show that AutoNeRF can reconstruct large-scale scenes, and is thus a useful tool to perform scene-specific adaptation as the produced 3D environment models can be loaded into a simulator to fine-tune a policy of interest.

연구 동기 및 목표

  • 미지의 3D 환경에서 몸체 기반 에이전트를 사용해 NeRF 학습을 위한 자율적 데이터 수집을 가능하게 한다.
  • 렌더링 품질 외에도 3D 환경 재구성, 계획, 자세 정밀화와 같은 로봇 작업에 관련된 후행 작업을 기준으로 NeRF를 평가한다.
  • 프론티어 기반, 엔드 투 엔드 강화학습, 모듈러 강화학습 등의 다양한 탐색 전략이 NeRF 학습 품질에 미치는 영향을 비교한다.
  • 강화학습에서의 보상 형상화가 학습된 암시적 표현의 후행 활용도에 어떤 영향을 미치는지 조사한다.
  • 단일 에피소드의 자율 탐색으로도 고품질의 장면 특화 3D 모델을 생성하여 시뮬레이션에서 정책 미세조정에 활용 가능함을 보여준다.

제안 방법

  • 3D 환경을 자율적으로 탐색하기 위해 고수준 계획자와 저수준 제어기를 포함하는 모듈러 강화학습 정책을 학습시킨다.
  • 카버리지, 노바일리티, 재구성, 장애물 회피, 시점 다양성 등의 다수의 보상 함수를 사용하여 탐색을 안내하고 NeRF 학습 데이터 품질을 최적화한다.
  • 에이전트가 수집한 데이터를 기반으로 학습된 NeRF 모델을 활용해 RGB 관측치로부터 연속적이고 미분 가능한 3D 환경 표현을 생성한다.
  • Fast Marching 및 기하학적 추론을 사용해 NeRF에서 벌지 염색도 지도와 세분적 지도를 생성하여 후행 계획 및 지ap 생성 작업에 활용한다.
  • 렌더링된 NeRF 출력을 기반으로 시각적 서보링 및 자세 정밀화 기법을 적용하여 카메라 시점 최적화를 수행한다.
  • Mask R-CNN을 사용해 RGB 관측치에서 세분적 마스크를 추정함으로써 지도 없는 정확한 애너테이션을 갖춘 엔드 투 엔드 세분적 NeRF 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1강화학습 기반 에이전트가 미지의 환경에서 단일 탐색 에피소드 내에 NeRF 학습에 필요한 데이터를 자율적으로 수집할 수 있는가?
  • RQ2다양한 탐색 전략(프론티어 기반, 엔드 투 엔드 강화학습, 모듈러 강화학습)이 여러 로봇 작업에서 후행 NeRF 품질에 어떤 영향을 미치는가?
  • RQ3탐색 과정에서 어떤 보상 함수가 3D 재구성, 계획, 렌더링 등의 NeRF 기반 작업에서 가장 높은 성능을 내는가?
  • RQ4자율적으로 수집된 데이터로부터 학습된 NeRF가 시뮬레이션에서 장면 특화 정책 적응에 얼마나 잘 기여하는가?
  • RQ5Mask R-CNN에서 유도된 노이즈가 많은 세분적 신호가 지도 없는 시뮬레이션 레이블에 비해 NeRF 기반 세분적 표현 품질에 어떤 영향을 미치는가?

주요 결과

  • 모든 후행 작업에서 프론티어 기반 탐색 및 엔드 투 엔드 강화학습 기반 베이스라인을 모두 초월하는 성능을 보이며, PointGoal 탐색에서 39.5%의 성공률과 ObjectGoal 탐색에서 16.0%의 SPL을 달성한다.
  • 시점 다양성에 보상하는 Ours (view.) 정책이 가장 높은 종합 성능을 보이며, PointGoal 작업에서 39.0% 성공률과 38.6% SPL을 기록한다.
  • 단일 에피소드의 자율 탐색 데이터로 학습된 NeRF는 고품질의 3D 환경 재구성 가능하며, 렌더링 작업에서 세분적 mIoU는 83.2%이며, 각 클래스 정확도는 91.8%이다.
  • NeRF 렌더링된 시점을 기반으로 한 자세 정밀화 기법은 이동 오차를 0.00734m로 줄이고, 회전 오차를 0.292°로 낮춰 기존 기반 방법을 능가한다.
  • Mask R-CNN에서 유도된 노이즈가 많은 세분적 신호가 있더라도 NeRF는 지도 비교에서 99.8%의 세분적 정확도와 ObjectGoal 계획에서 15.8%의 성공률을 기록하여 도메인 이동에 대해 뛰어난 내구성을 보였다.
  • 본 방법은 대규모 주거 환경 규모의 장면을 성공적으로 재구성하여 인간의 애너테이션 없이도 시뮬레이션에서 장면 특화 정책 미세조정이 가능함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.