[논문 리뷰] NeuPhysics: Editable Neural Geometry and Physics from Monocular Videos
NeuPhysics는 단일 영상에서 편집 가능한 3D 기하구조와 물리학을 복원하기 위한 방법을 제안한다. 이는 정적 기하구조를 위한 시간 불변의 부호거리함수**(SDF)**와 운동을 위한 시간 조건에 의존하는 변형장으로 분리된 신경장 표현을 사용한다. 신경장과 육면체 메시 간의 양방향 변환을 통해 상호작용적 편집과 미분 가능한 물리학 시뮬레이션을 가능하게 하며, 사이클 일致성 손실을 통한 엔드 투 엔드 최적화를 통해 메시 및 영상 복원에서 최신 기술 수준의 성능을 달성한다.
We present a method for learning 3D geometry and physics parameters of a dynamic scene from only a monocular RGB video input. To decouple the learning of underlying scene geometry from dynamic motion, we represent the scene as a time-invariant signed distance function (SDF) which serves as a reference frame, along with a time-conditioned deformation field. We further bridge this neural geometry representation with a differentiable physics simulator by designing a two-way conversion between the neural field and its corresponding hexahedral mesh, enabling us to estimate physics parameters from the source video by minimizing a cycle consistency loss. Our method also allows a user to interactively edit 3D objects from the source video by modifying the recovered hexahedral mesh, and propagating the operation back to the neural field representation. Experiments show that our method achieves superior mesh and video reconstruction of dynamic scenes compared to competing Neural Field approaches, and we provide extensive examples which demonstrate its ability to extract useful 3D representations from videos captured with consumer-grade cameras.
연구 동기 및 목표
- 단일 단일 RGB 영상에서 3D 기하구조 및 물리학 파라미터를 엔드 투 엔드로 학습하는 것.
- 단일 영상 3D 복원의 과소 결정 문제를 정적 기하구조와 동적 운동을 분리함으로써 해결하는 것.
- 양방향 메시-장 변환 파이프라인을 통해 신경 암시 표현과 미분 가능한 물리학 시뮬레이션을 연결하는 것.
- 메시를 직접 수정함으로써 신경장으로의 변화를 반영하는 상호작용적 3D 장면 편집을 지원하는 것.
- 수동적인 3D 모델 초기화에 의존하지 않고 영상 입력에서 기하구조와 물리학을 함께 최적화하는 것.
제안 방법
- 장면는 기하구조를 위한 시간 불변의 부호거리함수**(SDF)**와 외관, 강성, 시간 조건에 의존하는 운동 변형을 위한 별도의 신경장으로 표현된다.
- 운동은 3D 좌표를 기준 프레임 위치로 매핑하는 시간 조건에 의존하는 변형장을 통해 모델링되며, 시간에 따라 점별 대응 관계를 유지한다.
- 암시적 신경장과 명시적 육면체 메시 간의 양방향 변환이 구축되어 사용자가 메시를 편집하고 변화를 신경장으로 전파할 수 있도록 한다.
- 물리학 파라미터는 미분 가능한 물리학 시뮬레이터와 운동 장 사이의 사이클 일치성 손실을 최소화하여 최적화되며, 시뮬레이션된 동적 특성과 관측된 동적 특성 간의 일치를 보장한다.
- 강성 지ap은 동적 전경 물체와 배경을 분할하는 데 사용되며, 필요에 따라 사용자가 정의한 경계 상자로 전경 추출을 향상시킬 수 있다.
- 미분 가능한 렌더링**(NeuS)**과 물리학 시뮬레이션**(다양한 엔진)**을 통합하여 기하구조, 외관, 동역학의 공동 최적화를 통한 엔드 투 엔드 학습이 가능하다.
실험 결과
연구 질문
- RQ1단일 영상만으로 정확한 기하구조와 물리적으로 타당한 동적 특성을 갖춘 완전한 편집 가능한 3D 장면을 복원할 수 있는가?
- RQ2신경장이 정적 기하구조와 동적 운동으로 효과적으로 분리되어 복원 안정성과 품질을 향상시킬 수 있는가?
- RQ3수동적인 3D 모델 초기화 없이도 미분 가능한 물리학 시뮬레이터를 신경 암시 표현과 얼마나 잘 통합할 수 있는가?
- RQ4양방향 메시-장 변환 파이프라인을 통해 명시적 메시 편집을 통해 신경장의 상호작용적 편집을 가능하게 할 수 있는가?
- RQ5사이클 일치성 기반의 물리학 최적화는 체이밍 거리 최소화 방식보다 속도와 정확도 측면에서 어떻게 비교되는가?
주요 결과
- 제안된 사이클 일치성 손실은 체이밍 거리 방식을 사용할 경우 약 115초였던 총 최적화 시간을 약 67초로 단축시키며, 복원 및 시뮬레이션 품질은 유사하게 유지한다.
- 경쟁적인 신경장 기반 접근법 대비 메시 및 영상 복원 품질이 정량적·정성적으로 모두 향상된다.
- 강성 지도에서 임계값 0.2를 적용하면 배경-전경 분할이 안정적으로 이루어지며, 필요에 따라 수동 경계 상자를 추가로 사용하면 분할 성능을 더욱 향상시킬 수 있다.
- 운동 크기만으로는 순환 운동에서의 작은 이동량으로 인해 동적 물체 탐지에 부적절하므로, 강성 지도가 더 신뢰할 수 있는 기준이 된다.
- 양방향 메시-장 변환은 추가, 삭제, 변형 등의 직접적인 3D 장면 조작을 가능하게 하며, 일관된 신경장 표현을 유지한다.
- 이 프레임워크는 원시 단일 영상에서 물리 기반 애니메이션 및 시뮬레이션을 성공적으로 구현하여 디지털 트윈 및 상호작용적 3D 콘텐츠 제작의 잠재력을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.