Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning with Neural Radiance Fields

Danny Driess, Ingmar Schubert|arXiv (Cornell University)|2022. 06. 03.
Adversarial Robustness in Machine Learning인용 수 15
한 줄 요약

이 논문은 시각 기반 강화학습(RL)에서 표본 효율성을 향상시키기 위해 신경 렌더링 필드(NeRFs)를 자기지도 신호(self-supervision signal)로 사용하는 NeRF-RL을 제안한다. 다중 시점 RGB 이미지를 잠재 공간으로 매핑하는 인코더를 훈련시켜, 잠재 조건 기반 NeRF를 통해 장면을 재구성함으로써, 3D 인도크티브 비 biases(3D inductive bias)가 강한 NeRF의 특성 덕분에 로봇 조작 작업에서 기존의 2D CNN, 대조 학습, 심지어 전문가가 제공한 키포인트보다도 뛰어난 표본 효율성을 달성한다.

ABSTRACT

It is a long-standing problem to find effective representations for training reinforcement learning (RL) agents. This paper demonstrates that learning state representations with supervision from Neural Radiance Fields (NeRFs) can improve the performance of RL compared to other learned representations or even low-dimensional, hand-engineered state information. Specifically, we propose to train an encoder that maps multiple image observations to a latent space describing the objects in the scene. The decoder built from a latent-conditioned NeRF serves as the supervision signal to learn the latent space. An RL algorithm then operates on the learned latent space as its state representation. We call this NeRF-RL. Our experiments indicate that NeRF as supervision leads to a latent space better suited for the downstream RL tasks involving robotic object manipulations like hanging mugs on hooks, pushing objects, or opening doors. Video: https://dannydriess.github.io/nerf-rl

연구 동기 및 목표

  • 고차원 이미지 관측값에서 더 나은 상태 표현을 학습함으로써, 시각 기반 강화학습의 표본 효율성을 향상시키는 것.
  • 신경 렌더링 필드(NeRFs)의 3D 인도크티브 비 biases가 2D CNN이나 대조 학습보다 더 효과적인 잠재 표현을 이끌어낼 수 있는지 조사하는 것.
  • 수동으로 설계된 상태 정보에 의존하지 않고 다양한 물체 형태에 대해 일반화할 수 있도록 하는 것.
  • 복잡한 3D 조작 환경에서 NeRF 기반 지도 신호가 학습된 상태 표현이나 전문가가 제공한 상태 표현을 초월할 수 있음을 보여주는 것.

제안 방법

  • 다중 시점 RGB 이미지를 잠재 벡터로 매핑하는 인코더와, 새로운 시점에서 장면을 재구성하는 잠재 조건 기반 NeRF인 디코더를 갖춘 오토인코더를 훈련한다.
  • 다중 시점 이미지 재구성 손실을 자기지도 신호로 사용하여 인코더와 디코더를 함께 훈련하며, NeRF 디코더가 강력한 3D 인도크티브 비 bias를 제공한다.
  • 전역(global) 및 구성적(compositional) NeRF 디코더를 구현한다: 전역 디코더는 전체 장면을 인코딩하고, 구성적 디코더는 개별 물체를 인스턴스 세그멘테이션 마스크를 사용해 인코딩한다.
  • 랜덤 액션 데이터셋에서 사전 훈련을 수행한 후, 고정된 인코더를 사용하여 RL 루프 내에서 정책를 미세 조정한다.
  • 카메라 매트릭스와 다중 시점 이미지를 활용하여 3D 장면 이해를 향상시키고, 가림 현상을 해결한다.
  • 잠재 공간이 작업에 관련된 기하학적 및 공간적 구조를 잘 포착하도록, 사전 훈련 단계에서 NeRF 재구성 손실을 적용한다.

실험 결과

연구 질문

  • RQ1NeRF 기반 자기지도 신호가 2D CNN이나 대조 학습보다 시각 기반 RL에 더 효과적인 상태 표현을 이끌어낼 수 있는가?
  • RQ2NeRF의 3D 인도크티브 비 bias가 다양한 물체 형태를 포함한 로봇 조작 작업에서 표본 효율성과 일반화 능력을 향상시키는가?
  • RQ3다운스트림 RL 성능 측면에서 NeRF-RL은 전문가가 제공한 키포인트 지도 신호와 비교해 어떻게 성과를 내는가?
  • RQ4개별 물체를 모델링하는 구성적 NeRF 디코더가 전역 NeRF 디코더보다 성능을 향상시킬 수 있는가?
  • RQ5다중 카메라 시점의 사용이 학습된 잠재 표현의 품질을 향상시키는가?

주요 결과

  • NeRF-RL은 로봇 조작 작업에서 2D CNN 기반 오토인코더 및 대조 학습 기반 베이스라인보다 표본 효율성과 최종 성능에서 뚜렷한 우월성을 보였다.
  • 구성적 NeRF-RL 변종이 가장 높은 표본 효율성을 달성하여, NeRF를 사용해 개별 물체를 모델링하는 것이 전역 장면 모델링보다 더 효과적임을 시사한다.
  • NeRF-RL은 전문가가 제공한 키포인트 지도 신호를 초월하는 성능을 보였으며, 이는 NeRF 디코더의 3D 인도크티브 비 bias가 우월함을 입증한다.
  • 동일한 분포 내에서 다양한 시작 상태와 물체 형태에 대해 잘 일반화되었으며, 이는 강건성과 일반화 능력이 뛰어남을 나타낸다.
  • 개별 물체 마스크가 필요 없는 전역 NeRF-RL 변종도 모든 베이스라인을 압도했으며, 이는 인스턴스 수준의 지도 없이도 3D 인도크티브 비 bias가 효과적임을 보여준다.
  • 사전 훈련 비용이 높아(최대 2일)졌지만, 추론 시간은 약 7ms(예: RTX 3090 기준)로 낮아, 온라인 RL 구현에 실용적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.