Skip to main content
QUICK REVIEW

[논문 리뷰] Editing Conditional Radiance Fields

Steven Liu, Xiuming Zhang|arXiv (Cornell University)|2021. 05. 13.
3D Shape Modeling and Analysis참고 문헌 73인용 수 5
한 줄 요약

이 논문은 객체 카테고리에 대해 훈련된 조건부 레디언스 필드—신경 장면 표현 방식—를 사용하여 희소한 2D 사용자 스케치를 3D로 전파함으로써, 새로운 시각에서 일관된 색상 및 형태 편집을 가능하게 하는 방법을 제안한다. 공유된 형태 브랜치와 선택적 네트워크 업데이트를 활용하여 관련 네트워크 구성 요소만 효율적으로 수정함으로써, 최소한의 계산으로 고해상도의 편집을 달성하면서도 객체 구조를 유지한다.

ABSTRACT

A neural radiance field (NeRF) is a scene model supporting high-quality view synthesis, optimized per scene. In this paper, we explore enabling user editing of a category-level NeRF - also known as a conditional radiance field - trained on a shape category. Specifically, we introduce a method for propagating coarse 2D user scribbles to the 3D space, to modify the color or shape of a local region. First, we propose a conditional radiance field that incorporates new modular network components, including a shape branch that is shared across object instances. Observing multiple instances of the same category, our model learns underlying part semantics without any supervision, thereby allowing the propagation of coarse 2D user scribbles to the entire 3D region (e.g., chair seat). Next, we propose a hybrid network update strategy that targets specific network components, which balances efficiency and accuracy. During user interaction, we formulate an optimization problem that both satisfies the user's constraints and preserves the original object structure. We demonstrate our approach on various editing tasks over three shape datasets and show that it outperforms prior neural editing approaches. Finally, we edit the appearance and shape of a real photograph and show that the edit propagates to extrapolated novel views.

연구 동기 및 목표

  • 희소한 2D 사용자 입력을 사용하여 상호작용적이고 고해상도의 3D 장면 표현을 편집할 수 있도록 하는 것.
  • 암시적 신경 표현에서 거친 2D 편집을 전체 3D 영역으로 전파하는 과제를 해결하는 것.
  • 형태 편집과 색상 편집을 제어하는 네트워크 구성 요소를 식별하여 효율적인 최적화를 가능하게 하는 것.
  • 사용자가 지정한 편집을 만족시키면서도 원래 객체 구조를 유지하는 것.
  • 실사 사진과 합성 데이터셋에서 일관되고 시각 일관성을 갖춘 편집을 보여주는 것.

제안 방법

  • 객체 인스턴스 간에 공유되는 형태 브랜치를 갖춘 조건부 레디언스 필드를 도입하여, 감독 없이도 부분 수준의 의미를 학습한다.
  • 형태와 색상에 책임이 있는 후행 레이어만 선택적으로 최적화하는 하이브리드 네트워크 업데이트 전략을 제안하여 효율성을 향상시킨다.
  • 최적화 과정에서 원래 객체 구조를 유지하면서도 사용자 제약 조건을 강제로 반영하는 편집 손실을 설계한다.
  • 이중 단계 프로세스를 사용한다: 첫째, 공유된 형태 사전을 통해 2D 스케치를 3D로 전파한다; 둘째, 목표 네트워크 구성 요소를 사용자 편집에 맞게 최적화한다.
  • 신경 렲영과 알파 컴posit링을 활용하여 새로운 시점에서의 일관된 결과를 보장한다.
  • 합성 및 실사 이미지 편집에 이 방법을 적용하여, 미리 보지 못한 시점으로의 일반화 능력을 입증한다.

실험 결과

연구 질문

  • RQ1암시적 신경 표현에서 명시적인 3D 감독 없이도 희소한 2D 사용자 스케치를 신경 레디언스 필드 내에서 전체 3D 영역으로 효과적으로 전파할 수 있는가?
  • RQ2조건부 레디언스 필드 네트워크의 어떤 구성 요소가 형태 편집과 색상 편집을 제어하는가? 그리고 이들은 독립적으로 업데이트될 수 있는가?
  • RQ3조건부 레디언스 필드 내의 카테고리 수준 사전은 새로운 시점에서 일관되고 시각 일관성을 갖춘 편집을 가능하게 하는가?
  • RQ4편집을 효율적으로 수행하면서도 원래 객체 구조를 유지하고 잡음이나 이상 현상을 방지할 수 있는가?
  • RQ5실사 사진에 적용된 편집이 외삽된 새로운 시점으로 일반화되는가?

주요 결과

  • 이 방법은 2D 스케치를 전체 3D 영역으로 효과적으로 전파하여, 렌더링된 모든 시점에서 일관된 색상 및 형태 편집을 가능하게 한다.
  • 형태 또는 색상 편집을 위해 네트워크의 후행 레이어만 최적화함으로써, 전체 네트워크 미세조정 대비 높은 정밀도와 빠른 속도 향상을 달성한다.
  • 공유된 형태 브랜치 덕분에, 명시적인 부분 레이블 없이도 동일 카테고리의 새로운 부분으로도 편집이 제로샷 일반화가 가능하다.
  • PhotoShapes와 CARLA 차량 데이터셋을 포함한 세 가지 데이터셋에서 정량적·정성적 평가에서 기존 신경 편집 방법을 능가한다.
  • 실사 사진에 적용된 편집은 새로운 시점에서도 일관되게 렌더링되며, 훈련 데이터를 초월한 일반화 능력을 입증한다.
  • 시각 재구성 결과는 근사적으로 완벽한 일관성과 깊이 추정을 보여주며, 객체 인스턴스당 한 장의 이미지만으로도 훈련된 경우에도 성능이 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.