Skip to main content
QUICK REVIEW

[논문 리뷰] InNeRF360: Text-Guided 3D-Consistent Object Inpainting on 360-degree Neural Radiance Fields

Dongqing Wang, Tong Zhang|arXiv (Cornell University)|2023. 05. 24.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

InpaintNeRF360는 무한대 NeRF 시나리오를 위한 텍스트 유도형 3D 일致성 보정 프레임워크를 제안하며, 텍스트에서 유도된 다중 모odal 프롬프트를 활용해 프롬프터블 세그멘테이션 모델(SAM)과 깊이-공간 왜곡을 통해 시야 일치성 있는 객체 제거를 가능하게 한다. 2D 이미지 보정 사전 지식과 시각적 일관성 및 L1 손실을 사용한 NeRF 미세조정을 결합하여 사진 수준의 현실감 있고 기하학적 지식을 반영한 3D 보정을 달성한다. 자연어 지시어를 통한 정확하고 다중 객체 편집이 가능하다.

ABSTRACT

We propose InNeRF360, an automatic system that accurately removes text-specified objects from 360-degree Neural Radiance Fields (NeRF). The challenge is to effectively remove objects while inpainting perceptually consistent content for the missing regions, which is particularly demanding for existing NeRF models due to their implicit volumetric representation. Moreover, unbounded scenes are more prone to floater artifacts in the inpainted region than frontal-facing scenes, as the change of object appearance and background across views is more sensitive to inaccurate segmentations and inconsistent inpainting. With a trained NeRF and a text description, our method efficiently removes specified objects and inpaints visually consistent content without artifacts. We apply depth-space warping to enforce consistency across multiview text-encoded segmentations, and then refine the inpainted NeRF model using perceptual priors and 3D diffusion-based geometric priors to ensure visual plausibility. Through extensive experiments in segmentation and inpainting on 360-degree and frontal-facing NeRFs, we show that our approach is effective and enhances NeRF's editability. Project page: https://ivrl.github.io/InNeRF360.

연구 동기 및 목표

  • 암시적 NeRF 표현에서의 3D 시나리오 편집 과제를 해결하기 위해, 특히 360도 시야에서 기하학적 및 광학적 일관성을 유지하는 객체 제거 문제를 다룬다.
  • 형태가 시야에 따라 변하는 경우에 실패하는 2D 기반 보정 방법의 한계를 극복한다.
  • 수동 세그멘테이션 마스크 없이 자연어 지시어를 통한 직관적인 3D 편집을 가능하게 하여 사용자 접근성과 제어력을 향상시킨다.
  • 다중 시야 감시와 시각적 사전 지식을 활용해 보정된 3D 시나리오의 시야 일致성과 시각적 타당성을 확보한다.

제안 방법

  • 텍스트 지시어가 다중 모달 프롬프트로 인코딩되어 Segment Anything Model(SAM)의 다중 시야 인스턴스 세그멘테이션을 유도한다.
  • 깊이-공간 왜곡을 적용해 2D 세그멘테이션 마스크를 시야 간 전파하고 정밀화하여 객체 정체성의 3D 일관성을 강화한다.
  • 세그멘테이션 마스크를 사용해 사전 훈련된 이미지 보정 모델이 다중 시야 이미지에서 시각적으로 타당한 2D 보정 결과를 생성한다.
  • 픽셀 단위의 L1 손실과 마스크된 시각적 손실(LPIPS)을 조합한 하이브리드 손실을 사용해 NeRF 모델을 미세조정하여 시각적 일관성을 유지한다.
  • 미세조정 중 사전 훈련된 NeRF의 3D 일관성을 활용해 시야 일관성을 추가로 강화한다.
  • 프롬프트 엔지니어링 없이도 자연어 프롬프트를 기반으로 다중 객체 편집 또는 객체 외관 수정이 가능하다.

실험 결과

연구 질문

  • RQ1텍스트 기반 3D 보정이 무한대 NeRF 시나리오에서 360도 시야 간 일관된 객체 제거를 달성할 수 있는가?
  • RQ2깊이-공간 왜곡이 다중 시야 세그멘테이션 중 객체 정체성 일관성을 유지하는 데 얼마나 효과적인가?
  • RQ32D 이미지 보정 사전 지식과 NeRF 미세조정을 조합했을 때, 시각적으로 타당하고 시야 일관성이 있는 3D 결과를 생성할 수 있는가?
  • RQ4시간적 및 시야 일관성 측면에서 이 방법은 프레임별 보정과 비교해 얼마나 우수한가?
  • RQ5사용자 수동 마스크 입력 없이 자연어 지시어만으로 정확하고 객체 수준의 편집이 가능한가?

주요 결과

  • 정원 시나리오에서 InpaintNeRF360은 시야 일관성에 대해 86%의 사용자 선호도를 기록했으며, 프레임별 보정 대비 14% 선호도를 뛰어넘었다.
  • 컵 및 스타벅스 데이터셋에서 InpaintNeRF360은 LPIPS 0.6201과 FID 168.39를 기록했으며, 프레임별 보정 대비 LPIPS 0.6375, FID 181.57를 기록해 우월한 성능을 보였다.
  • 마스크된 시각적 손실의 포함으로 3D 시나리오에서 흐릿한 아티팩트가 감소했으며, L1 손실 전용 훈련 대비 정성적 비교에서 흐릿한 현상이 광범위하게 발생하지 않음을 확인했다.
  • 한 번의 텍스트 지시어, 예를 들어 '화분과 꽃들을 제거하라'로 동시에 여러 객체를 성공적으로 제거할 수 있었다.
  • 마스크 조건 기반 이미지 편집기로 수정된 InpaintNeRF360은 In2n이 큰 의도하지 않은 영역에 스타일을 적용하는 것과 달리 정확한 객체 스타일링을 가능하게 했다.
  • 이 프레임워크는 무한대 및 정면 시야 시나리오 모두에 일반화되어 다양한 실제 데이터셋에서 뛰어난 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.