[논문 리뷰] DeformGS: Scene Flow in Highly Deformable Scenes for Deformable Object Manipulation
MD-Splatting는 캐논리컬 가우시안 표현에서 연속적인 메트릭 변형을 학습함으로써, 음영과 가림을 동반한 고도로 비틀림이 큰 장면에서 동시에 3D 추적과 새로운 시점 합성에 대한 새로운 방법을 제안한다. 최신 기술 대비 평균 16.7% 향상된 3D 추적 정확도를 달성하였으며, 강한 무늬와 복잡한 변형이 존재하는 1×1m 천에 대해 최소 3.39mm의 중앙값 추적 오차를 기록하였다.
Teaching robots to fold, drape, or reposition deformable objects such as cloth will unlock a variety of automation applications. While remarkable progress has been made for rigid object manipulation, manipulating deformable objects poses unique challenges, including frequent occlusions, infinite-dimensional state spaces and complex dynamics. Just as object pose estimation and tracking have aided robots for rigid manipulation, dense 3D tracking (scene flow) of highly deformable objects will enable new applications in robotics while aiding existing approaches, such as imitation learning or creating digital twins with real2sim transfer. We propose DeformGS, an approach to recover scene flow in highly deformable scenes, using simultaneous video captures of a dynamic scene from multiple cameras. DeformGS builds on recent advances in Gaussian splatting, a method that learns the properties of a large number of Gaussians for state-of-the-art and fast novel-view synthesis. DeformGS learns a deformation function to project a set of Gaussians with canonical properties into world space. The deformation function uses a neural-voxel encoding and a multilayer perceptron (MLP) to infer Gaussian position, rotation, and a shadow scalar. We enforce physics-inspired regularization terms based on conservation of momentum and isometry, which leads to trajectories with smaller trajectory errors. We also leverage existing foundation models SAM and XMEM to produce noisy masks, and learn a per-Gaussian mask for better physics-inspired regularization. DeformGS achieves high-quality 3D tracking on highly deformable scenes with shadows and occlusions. In experiments, DeformGS improves 3D tracking by an average of 55.8% compared to the state-of-the-art. With sufficient texture, DeformGS achieves a median tracking error of 3.3 mm on a cloth of 1.5 x 1.5 m in area. Website: https://deformgs.github.io
연구 동기 및 목표
- 강한 음영과 복잡한 가림을 동반한 고도로 비틀림이 큰 장면에서 정확한 3D 추적 문제를 해결한다.
- 동적인 장면에서 고품질의 새로운 시점 합성과 메트릭 3D 추적을 동시에 가능하게 한다.
- 기존 방법들이 캐논리컬 공간에서 가우시안을 최적화하지만 연속적인 메트릭 변형 복구 기능이 없는 한계를 극복한다.
- 물리학 기반 정규화를 도입하여 강한 음영과 복잡한 운동이 존재하는 장면에서의 강인성과 일반화 능력을 향상시킨다.
- 기존 접근 방식보다 시퀀스 길이에 민감도가 낮은 확장 가능하고 효율적인 훈련 파이프라인을 제공한다.
제안 방법
- 캐논리컬이고 메트릭이 아닌 성질을 지닌 4D 가우시안을 학습 가능한 장면 표현으로 활용한다.
- 신경 메시바 인코딩과 다층 퍼셉트론(MLP)을 사용해 시간에 따라 변형된 가우시안의 위치, 회전 및 음영 스케일러를 예측한다.
- 빠르고 미분 가능한 래스터라이제이션과 훈련 중 광학 일致성 손실을 위해 미분 가능한 래스터라이저를 사용한다.
- 물리학 기반 정규화를 적용: 국소적 강성, 운동량 보존, 등장성 변형을 통해 변형 학습을 안정화시킨다.
- 전체 시퀀스를 한 번에 최적화하는 대신 시간 단위로 단계적으로 훈련하여 기존의 종단 간 최적화 대비 시퀀스 길이에 따른 훈련 시간 민감도를 감소시킨다.
- 등장성 정규화를 학습 가능한 초모수를 통해 조정하여 추적 정확도와 렌더링 품질 간 균형을 이룬다.
실험 결과
연구 질문
- RQ1캐논리컬 가우시안 표현을 사용해 음영과 가림이 존재하는 고도로 비틀림이 큰 장면에서 연속적인 메트릭 변형을 학습할 수 있는가?
- RQ2물리학 기반 정규화(예: 등장성, 운동량 보존)는 추적 안정성과 정확도에 어떻게 기여하는가?
- RQ3극한의 변형 조건 하에서 MD-Splatting은 3D 추적과 새로운 시점 합성 모두에서 기존 기법들을 얼마나 뛰어나게 성능을 향상시키는가?
- RQ4등장성 정규화와 렌더링 품질 간의 트레이드오���이 다양한 장면 유형에서 성능에 어떻게 영향을 미치는가?
- RQ5복잡한 무늬와 큰 변형이 존재하는 장면에서도 이 방법은 고해상도 재구성과 낮은 추적 오차를 유지하면서 일반화 가능한가?
주요 결과
- MD-Splatting는 6개의 합성 장면에서 최신 기술인 Dynamic 3D Gaussians [33] 대비 평균 16.7% 향상된 3D 추적 정확도를 확보하였다.
- 강한 무늬가 존재하는 Scene 6에서 1×1m 천에 대해 큰 변형 조건에서도 MD-Splatting는 중앙값 추적 오차 3.39mm를 기록하였다.
- 모든 장면에서 평균 PSNR 39.1을 기록하여 고품질의 새로운 시점 합성을 달성하였다.
- MD-Splatting는 Dynamic 3D Gaussians 대비 훈련 시간이 시퀀스 스텝 수에 대해 훨씬 덜 민감하며, 10단계 시퀀스 기준 훈련 시간이 2.5배 감소하였다.
- 등장성 정규화 항($\mathcal{L}^{\text{iso}}$)은 $10^{-0.5}$에서 최적의 추적 성능를 기록하였으며, 여러 장면에서 공통적인 국소 최적점으로 나타났다.
- 저무늬 및 복잡한 변형이 존재하는 장면에서 MD-Splatting는 DeVRF 및 DynaGS와 같은 베이스라인보다 뛰어난 성능을 보였으며, 다른 방법들이 실패하거나 세부 정보를 흐리게 하는 상황에서도 우수한 성능 유지를 하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.