[논문 리뷰] Volumetric Disentanglement for 3D Scene Manipulation
이 논문은 신경 볼륨 렌더링 장면을 사용하여 3D 장면에서 전경 물체를 배경에서 분리하는 볼륨 분리 프레임워크를 제안한다. 이는 색상, 깊이, 3D 변환을 독립적으로 조작할 수 있도록 하며, 2D 마스크, 시점, 자세를 기반으로 훈련함으로써 전경과 배경 볼륨을 분리하면서도 조명, 반사, 음영 효과를 유지한다. 이로 인해 시점 간 일관성이 높은 객체 카모플라주, 인painting, 텍스트 기반 편집과 같은 의미론적 3D 조작이 가능해진다.
Recently, advances in differential volumetric rendering enabled significant breakthroughs in the photo-realistic and fine-detailed reconstruction of complex 3D scenes, which is key for many virtual reality applications. However, in the context of augmented reality, one may also wish to effect semantic manipulations or augmentations of objects within a scene. To this end, we propose a volumetric framework for (i) disentangling or separating, the volumetric representation of a given foreground object from the background, and (ii) semantically manipulating the foreground object, as well as the background. Our framework takes as input a set of 2D masks specifying the desired foreground object for training views, together with the associated 2D views and poses, and produces a foreground-background disentanglement that respects the surrounding illumination, reflections, and partial occlusions, which can be applied to both training and novel views. Our method enables the separate control of pixel color and depth as well as 3D similarity transformations of both the foreground and background objects. We subsequently demonstrate the applicability of our framework on a number of downstream manipulation tasks including object camouflage, non-negative 3D object inpainting, 3D object translation, 3D object inpainting, and 3D text-based object manipulation. Full results are given in our project webpage at https://sagiebenaim.github.io/volumetric-disentanglement/
연구 동기 및 목표
- 증강현실 환경에서 전경 물체를 배경에서 분리함으로써 의미론적 3D 장면 조작을 가능하게 한다.
- 분리 과정 동안 조명, 반사, 부분적인 음영 효과와 같은 복잡한 시각적 효과를 유지한다.
- 전경 및 배경 물체의 색상, 깊이, 3D 변환에 대해 독립적인 제어를 가능하게 한다.
- 광학 투과형 증강현실 환경의 제약 조건을 고려해 음수를 포함하지 않고 깊이를 유지하는 조작을 지원한다.
- CLIP 유도 최적화를 통해 텍스트 기반 3D 물체 조작을 실현하며, 다중 시점 간 의미 일관성을 확보한다.
제안 방법
- 전체 장면과 배경 전용으로 각각 신경 볼륨 렌더링 장면을 훈련하며, 2D 훈련 시점, 자세, 인스턴스 마스크를 사용한다.
- 전경 볼륨은 볼륨 뺄셈을 통해 계산된다: 전경 = 전체 장면 - 배경으로서, 공간적 및 복사 일관성을 유지한다.
- 각 볼륨에 대해 별도의 신경망을 사용하여 색상과 밀도를 분리한다.
- 다양한 기반 렌더링을 통해 전경 및 배경 볼륨에 대해 독립적인 3D 변환(이동, 회전, 스케일)을 적용한다.
- 텍스트 기반 조작은 CLIP 임베딩을 활용해 전경 물체의 형태와 외관을 최적화하면서도 배경의 의미를 유지한다.
- 프레임워크는 새로운 시점 렌더링을 지원하며, 미분 가능한 볼륨 렌더링과 암묵적 장면 표현을 통해 다중 시점 간 일관성을 유지한다.

실험 결과
연구 질문
- RQ1복잡한 시각적 효과(예: 반사, 음영)를 유지하면서도, 미분 가능하고 신경 볼륨 렌더링 기반 프레임워크에서 볼륨 분리를 달성할 수 있는가?
- RQ2색상, 깊이, 자세 측면에서 전경 및 배경 물체가 3D 공간에서 얼마나 독립적으로 조작될 수 있는가?
- RQ3광학 투과형 제약 조건 하에서 비음수 3D 인painting 및 물체 카모플라주에 대해 이 방법이 얼마나 잘 일반화되는가?
- RQ4다중 시점 간 높은 정확도와 일관성을 확보하면서 텍스트 기반 의미론적 3D 물체 조작을 실현할 수 있는가?
- RQ5노이즈가 많거나 자동으로 생성된 2D 마스크에 대해 이 방법은 얼마나 강인한가?
주요 결과
- 이 방법은 훈련 및 새로운 시점 간에 조명, 반사, 부분적인 음영 효과를 유지하면서도 전경과 배경 볼륨을 성공적으로 분리한다.
- 고품질의 시각적 일관성을 확보하면서도 물체 이동, 카모플라주, 음수를 포함하지 않는 인painting 등의 일관된 3D 조작을 가능하게 한다.
- 사용자 연구 결과, '딸기', '오래된 나무'와 같은 텍스트 기반 조작이 여러 시점에서 의미적으로 일관되고 인지적으로 타당한 것으로 평가되었다.
- 이 방법은 외부에서 제공하는 세그멘테이션 모델에서 유도된 노이즈가 많은 2D 마스크를 처리할 수 있어, 불완전한 애너테이션에 대해 강인함을 입증하였다.
- 절단 실험 결과, 볼륨 뺄셈(전체 - 배경) 방식이 부족한 제약 조건으로 인해 최적화가 어려운 직접 전경 필드 훈련보다 우수한 성능을 보였다.
- 한계점으로는 빛의 원천이 완전히 분리되지 않으며, CLIP 신호가 부족한 경우 큰 물체 조작에 어려움이 있다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.