Skip to main content
QUICK REVIEW

[논문 리뷰] LERF: Language Embedded Radiance Fields

Justin Kerr, Chung Min Kim|arXiv (Cornell University)|2023. 03. 16.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

LERF는 CLIP 언어 특징을 신경 렌더링 필드(NeRF)에 직접 통합하여 다중 척도, 3D 연속적 언어 필드를 생성함으로써, 미세조정이나 영역 제안 없이도 다양한 시각적 및 추상적 개념에 대해 실시간으로 픽셀 정렬된, 제로샷 언어 쿼리를 가능하게 한다. 주요 기여는 2D 기반 대비 실세계 환경에서 개방형 어휘의 국소화 성능을 뛰어나게 하는 3D 일致성 있고 시야에 맞춘 관련성 맵 생성 시스템이다.

ABSTRACT

Humans describe the physical world using natural language to refer to specific 3D locations based on a vast range of properties: visual appearance, semantics, abstract associations, or actionable affordances. In this work we propose Language Embedded Radiance Fields (LERFs), a method for grounding language embeddings from off-the-shelf models like CLIP into NeRF, which enable these types of open-ended language queries in 3D. LERF learns a dense, multi-scale language field inside NeRF by volume rendering CLIP embeddings along training rays, supervising these embeddings across training views to provide multi-view consistency and smooth the underlying language field. After optimization, LERF can extract 3D relevancy maps for a broad range of language prompts interactively in real-time, which has potential use cases in robotics, understanding vision-language models, and interacting with 3D scenes. LERF enables pixel-aligned, zero-shot queries on the distilled 3D CLIP embeddings without relying on region proposals or masks, supporting long-tail open-vocabulary queries hierarchically across the volume. The project website can be found at https://lerf.io .

연구 동기 및 목표

  • 언어 임베딩을 직접 NeRF에 기반하여 3D 시각화에 자연어 상호작용을 가능하게 하기 위해.
  • NeRF의 의미적 정보 부족 문제를 해결하기 위해 사전 구축된 CLIP 임베딩을 3D 연속적 필드에 통합하기 위해.
  • 데이터셋 특화 미세조정이나 영역 제안 없이도 다양한 언어 쿼리—추상적, 시각적, 장꼬리형, 텍스트 기반—을 지원하기 위해.
  • 다양한 시야와 척도에서 CLIP 임베딩의 볼륨 렌더링을 통해 다중 척도, 3D 일관성 있는 관련성 맵을 생성하기 위해.
  • 손실이 최소한인 NeRF 학습 속도에 영향을 최소화하면서도, 수동으로 3D 시나리오를 실시간으로 상호작용 가능한 언어로 쿼리할 수 있도록 하기 위해.

제안 방법

  • LERF는 3D 공간 좌표와 물리적 척도 $s$를 입력으로 받아 CLIP 임베딩을 출력하는 3D 언어 필드 $F_{\text{lang}}(x,y,z,s)$를 최적화함으로써 다중 척도 언어 기반을 가능하게 한다.
  • 학습 중에 각 학습 시야의 다중 척도 컷에서 CLIP 임베딩을 추출하고, NeRF 레이에 대응하는 특징 피라미드를 통해 감독 신호로 사용한다.
  • 예측된 CLIP 임베딩과 진짜 값 간의 코사인 유사도를 최대화하기 위해 대조 손실을 사용하여 언어 필드를 학습한다.
  • 공유된 블로킹을 통해 자기지도 학습 DINO 특징을 통합하여 언어 필드의 부드러움과 경계 정의를 향상시킨다.
  • NeRF의 밀도 필드에서 유도된 렌더링 가중치를 사용하여 레이를 따라 CLIP 임베딩을 볼륨 렌더링으로 통합한다.
  • 추론 시, 임의의 언어 프롬프트를 3D 필드에 임bedding하여 실시간, 3D 연속적 관련성 맵을 생성하여 상호작용 가능한 쿼리에 활용한다.

실험 결과

연구 질문

  • RQ1미세조정이나 영역 제안 없이도 CLIP 임베딩을 3D NeRF에 효과적으로 기반시킬 수 있는가?
  • RQ23D에서 다중 척도 언어 필드는 개방형 어휘 쿼리에 대해 2D 기반 대비 더 나은 국소화 및 일관성을 달성할 수 있는가?
  • RQ3다중 척도 감독은 추상적, 장꼬리형, 시각적 쿼리 등 다양한 쿼리에 대해 언어 임베딩의 일반화를 어떻게 향상시키는가?
  • RQ4DINO 특징을 통합할 경우 관련성 맵의 품질과 선명도는 어느 정도 향상되는가?
  • RQ5LERF는 휴대형 장치에서 촬영한 3D 시나리오에서 실시간, 제로샷, 픽셀 정렬된 언어 쿼리를 가능하게 할 수 있는가?

주요 결과

  • LERF는 '전기'와 같은 추상적 개념이나 'Waldo'와 같은 장꼬리형 객체를 포함한 다양한 언어 쿼리에 대해 실시간으로 상호작용 가능한 3D 관련성 맵 생성을 가능하게 한다.
  • LERF는 LSeg와 OWL-ViT와 같은 2D 개방형 어휘 검출기보다 3D 국소화 정확도에서 뛰어나며, 특히 장꼬리형 및 세밀한 쿼리에서 두각을 나타낸다.
  • DINO 감독을 통합함으로써 관련성 맵의 부드러움과 경계 정의가 크게 향상되었으며, 특히 저시야 또는 복잡한 기하학적 영역에서 두드러진다.
  • 다중 척도 학습은 필수적이다: 이를 제거하면 '에스프레소 머신'과 같은 거시적 쿼리뿐 아니라 '크림퍼 오디오'와 같은 세밀한 쿼리에서도 성능이 저하된다.
  • LERF는 시나리오 전반에 걸쳐 시야 일관성 있는 3D 관련성 맵을 생성하며, 정성적 결과는 의미적 및 시각적 신호와 강력한 일치를 보여준다.
  • 실패 사례로는 외관상 또는 의미적으로 유사한 물체(예: '호박'이 다른 녹색 야채에 영향을 미침)에서의 거짓 양성 반응과 공간 추론의 제한성(예: '테이블'이 가장자리에만 반응함)

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.